La reconnaissance faciale (FR) en vidéo continue de susciter un intérêt considérable de la part des milieux universitaires et de l’industrie en raison du large éventail d’applications dans les domaines de la surveillance et de la sécurité. Malgré les progrès récents en matière de vision par ordinateur et d’apprentissage machine, la conception d’un système robuste pour de reconnaissance faciale en temps réel pour les applications de surveillance reste un défi important. Un problème clé est la divergence entre les visages du domaine source, où les visages de référence sont de haute qualité et capturés dans des conditions contrôlées par des caméras fixes, et ceux du domaine cible, où les images vidéo sont capturées avec des caméras vidéo dans des conditions non contrôlées avec des variations de pose, éclairage, flou, etc. L’apparence des visages capturés dans les vidéos correspond à de multiples distributions de données pouvant différer considérablement des visages initialement capturés. Un autre défi de la vidéo est le nombre limité de photos de référence disponibles par personne cible pour la conception de modèles de visage. Ce scénario est courant dans les applications de sécurité et de surveillance basées sur la vidéo, comme par exemple l’authentification biométrique et le triage avec une liste de surveillance. Les performances des systèmes vidéos peuvent diminuer considérablement en raison de la quantité limitée d’information disponible pour représenter les variations intra-classe observées dans les images.
Cette thèse propose des techniques d’augmentation des données basées sur la synthèse des visages pour surmonter les défis posés par la variation des visages et le nombre limité d’images d’entraînement. Le principal avantage des approches proposées est la possibilité de fournir un ensemble compact capable de représenter avec précision le visage de référence d’origine avec des variations pertinentes aux condition de capture dans le domaine cible. En particulier, cette thèse présente 3 nouveaux systèmes pour une reconnaissance faciale robuste en vidéo qui sont basés sur l’augmentation synthétique des galeries de référence.
Dans une première contribution, une approche de synthèse de visage exploitant les informations de variation représentatives intra-classe du domaine cible est proposée. Cette approche, appelée synthèse de visages spécifique à un domaine, génère un ensemble compact de visages synthétiques qui ressemblent à des individus d’intérêt dans les conditions de capture pertinentes pour le domaine cible. Dans une implémentation particulière basée représentation clairsemée, les visages synthétiques générés sont utilisés pour former un dictionnaire interdomaine tenant compte de la structure de la clarté, où les blocs de dictionnaire combinent les visages d’origine et synthétique de chaque individu. Les résultats expérimentaux obtenus avec des vidéos des bases de données Chokepoint et COX-S2V révèlent qu’augmenter le nombre de galeries de référence de systèmes la FR en vidéo en utilisant l’approche proposée par une approche synthèse de visage peut fournir un niveau de précision nettement supérieur à celui de l’état de l’art.
Dans un deuxième temps, nous proposons un modèle de représentation par paires fragmentées permettant l’utilisation d’informations conjointe variationnelles et d’images de visage synthétiques. Le modèle proposé, appelé modèle de synthèse plus variationnel, reconstruit une image sonde en utilisant conjointement (1) un dictionnaire variationnel conçu avec un ensemble générique et (2) un dictionnaire de galerie complété par un ensemble d’images synthétique générées sur une grande diversité des angles de pose. Le dictionnaire de galerie augmentée est ensuite encouragé à partager le même motif de parcimonie avec le dictionnaire de variation pour d’angles de pose similaires en résolvant un problème d’optimisation simultané basé sur la parcimonie. Les résultats expérimentaux obtenus sur les données Chokepoint et COX-S2V, indiquent que l’approche proposée peut surpasser les méthodes représentation clairsemé de pointe pour la FR en vidéo continue avec un seul échantillon par personne.
Troisièmement, un réseau siamois profond, appelé SiamSRC, est proposé pour effectuer une mise en correspondance des visages à l’aide d’une représentation clairsemée. L’approche proposée étend la galerie en utilisant un ensemble d’images de visage synthétiques et exploite la représentation clairsemé avec une structure de blocs pour la correspondance des visages par paires qui trouve la représentation d’une image sonde nécessitant le nombre minimal de blocs de la galerie. Les résultats expérimentaux obtenus avec les bases de données Chokepoint et COX-S2V suggèrent que le réseau SiamSRC proposé permet une représentation efficace des variations intra-classe avec une augmentation modérée de la complexité temporelle. Les résultats ont montré que les performances des systèmes d’images fixes à vidéo continue basées sur SiamSRC peuvent être améliorées grâce à la synthèse des visages, sans qu’il soit nécessaire de collecter une grande quantité de données d’entraînement.
Des expérimentations approfondies ont été menées sur deux ensembles de données de surveillance disponibles au public. Les résultats ont indiqué que la synthèse de visage à elle seule ne peut pas résoudre efficacement les défis du échantillons limités et les problèmes de changement de domaine visuel. Les techniques proposées, à savoir l’intégration de la synthèse des visages et de l’apprentissage générique, peuvent fournir un niveau de précision supérieur à celui des approches de pointe avec un seul échantillon par personne.
| Date | 24 janv. 2020 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Éric Granger (Directeur(-trice)) |
|---|
- Reconnaissance de visage
- synthèse de visage
- reconstruction du visage en 3D
- surveillance vidéo
- adaptation de domaine
- représentation clairsemée
- apprentissage générique
Mokhayyeri, F. (Auteur(e)),
Granger, É. (Directeur(-trice)),
24 janv. 2020Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie