Au cours des dernières décennies, la reconnaissance de visage (RV) a connu une attraction importante dans de nombreuses applications, telles que l’application de la loi, la médecine légale, le contrôle d’accès, la sécurité de l’information et la vidéosurveillance, en raison de sa nature cachée et non intrusive. Les systèmes RV spécialisés pour la vidéosurveillance cherchent à détecter avec précision la présence d’individus d’intérêt sur un réseau distribué de cameras vidéo dans des conditions de capture incontrôlées. Par conséquent, reconnaître les visages des individus ciblés dans un tel environnement est un problème complexe parce que l’apparence des visages varie en raison des changements de pose, d’échelle, d’illumination, d’occlusion, de flou, etc. La complexité de calcul est également une considération importante en raison du nombre croissant de caméras, le temps de calcul des algorithmes de détection de visage, de suivi d’objet et de classification à la fine pointe de la technologie.
Dans cette thèse, des systèmes adaptatifs sont proposés pour une RV fidèle à la vidéo, où un seul (ou très peu) échantillon de références de visage est disponible pour concevoir un modèle de visage de chaque individu d’intérêt. Cette situation correspond à un mode d’utilisation reel et courant dans les applications de surveillance à partir d’une liste de contrôle en raison du coût de la capture d’images de référence, de leur et faisabilité ardue et de la gestion complexe des modèles de visage en évolution dans le temps. De plus, le nombre limité de references faciales peut avoir une incidence défavorable sur la robustesse des modèles de visages dû aux faibles variations intra classes de ceux-ci, ce qui affecte par conséquent la performance des systèmes de RV sur vidéos. En outre, un défi spécifique pour la RV de type image-à-video sont les différences perçues entre le domaine d’enregistrement, où les visages de référence de haute qualité sont acquises avec des conditions de capture contrôlées à partir de caméras fixes, et le domaine opérationnel, où les visages sont acquises à l’aide de caméras vidéo sujettes aux conditions de capture incontrôlées. Pour surmonter le défi introduit à partir d’un unique échantillon de visage par personne, 3 nouveaux systèmes sont proposés. Ceux-ci reposent sur des représentations multiples de visages et une adaptation de domaine pour assurer une RV fidèle à la vidéo. En particulier, cette thèse présentera 3 contributions qui seront sommairement présentées aux paragraphes qui suivront. Ces contributions seront décrites en plus grand details aux chapitres correspondants.
Au chapitre 3, une approche multi-classificateurs est proposée pour une RV image-à-vidéo robuste basée sur des représentations de visage multiples et diverses de la référence image unique d’un même individu. Lors de l’enregistrement d’un individu d’intérêt dans le système, le visage de référence unique est toujours modélisé en utilisant un ensemble de classificateurs SVM basés sur des descripteurs extraits à partir de subdivisions différentes du visage de l’individu. Plusieurs techniques d’extraction de caractéristiques sont appliquées aux subdivisions isolées dans l’image de référence pour générer un groupe de SVM diversifié qui fournit une robustesse contre les facteurs nuisibles courants (ex : variations d’éclairage et de pose). L’estimation des sous-ensembles de caractéristiques discriminantes, des paramètres des classificateurs, des seuils de décision et des fonctions de fusion d’ensemble est obtenue à l’aide d’une image de référence de haute qualité et d’un grand nombre de visages capturés dans une vidéo de qualité inférieure des individus non ciblés dans la scène. Lors de la mise en opération, le sousensemble de SVM le plus compétent est sélectionné dynamiquement en fonction des conditions de capture observées. Enfin, un algorithme de suivi de visage regroupe graduellement les visages capturés par personnes correspondantes apparaissant dans la scène, tandis que chaque ensemble spécifique à l’individu effectue une classification de visage. L’accumulation de scores correspondants par trajectoire de visage mène vers une RV spatio-temporelle robuste lorsque les scores d’ensemble cumulés dépassent un seuil de détection. Les résultats expérimentaux obtenus avec les bases de données Chokepoint et COX-S2V montrent une amélioration significative de la performance par rapport aux systèmes de référence, en particulier lorsque les ensembles spécifiques à chaque individu (1) sont conçus en utilisant des SVM exemplaires plutôt que des SVM à classe unique, et (2) exploitent la fusion au niveau des scores des SVM locaux (formés à l’aide des fonctionnalités extraites de chaque subdivision du visage), plutôt que d’utiliser soit la fusion au niveau de la décision ou au niveau des caractéristiques avec un SVM global (forms par une concaténation des descripteurs de caractéristiques extraits des subdivisions du visage).
Au chapitre 4, un système multi-classificateurs (SMC) efficace est proposé pour une RV fidèle à la vidéo en fonction des représentations multiples et de l’adaptation de domaine (AD). Un ensemble de classificateurs exemplaires SVM (e-SVM) par individu est ainsi conçu pour améliorer la robustesse face aux variations intra classes. Lors de l’enregistrement d’un individu cible dans le système, un ensemble de classificateurs est encore une fois utilisé pour modéliser chaque référence unique, où les descripteurs de visage multiples et les sous-espaces de caractéristiques sélectionnées aléatoirement permettent de générer un groupe diversifié de classificateurs pour chaque subdivision de visage. Pour adapter ces ensembles au domaine opérationnel, les e-SVM sont entraînés à l’aide des subdivisions de visage étiquetées et extraites de l’image de référence de l’individu d’intérêt contre celles extraites des images fixes de référence correspondant à plusieurs autres individus non ciblées, en plus des subdivisions de visages non étiquettées extraites à partir des trajectoires vidéos capturées par des caméras de surveillance. Pendant la phase opérationnelle, les classificateurs les plus compétents par visage de test donné sont sélectionnés dynamiquement et pondérés en fonction des critères internes predetermines avec l’espace de caractéristiques des e-SVM. Ce chapitre présentera également une étude de l’impact associée à l’utilisation de différents schémas d’entraînement pour l’AD, ainsi que l’utilisation d’un ensemble de validation de visages formé des images fixes d’individus non ciblées et des trajectoires vidéos d’individus inconnus dans le domaine opérationnel. Les résultats indiquent que le système proposé peut dépasser la précision des techniques utilisées dans la littérature, mais avec une complexité de calcul nettement inférieure.
Au chapitre 5, un réseau de neurones convolutif (RNC) profond est proposé pour faire face aux divergences observées entre les régions d’intérêt du visage isolées dans les images fixes et celles sur vidéo pour une RV robuste. À cette fin, un auto-encodeur de visage RNC appelé FFACNN est entraîné à l’aide de régions d’intérêt fixes et sur vidéos à l’aide d’un apprentissage multi-tâches supervisé de bout en bout du réseau. Une nouvelle fonction de coût combinant une pondération des coûts liés aux pixels, à la symétrie et la conservation de l’identité est introduite pour optimiser les paramètres de ce réseau de neurones. Le système FFA-CNN proposé integer à la fois un réseau de reconstruction et un réseau de classification entièrement connecté, où le premier reconstruit une région d’intérêt frontale bien éclairée avec une expression de visage neutre à partir d’une paire de régions d’intérêt vidéo non frontales de basse qualité, et où le second est utilisé pour comparer les représentations d’image fixe et sur vidéo pour fournir des scores de classification. Ainsi, l’intégration de la fonction de perte pondérée proposée avec une approche d’apprentisage supervisé de bout en bout permet de générer des visages frontaux de haute qualité et d’apprendre des représentations de caractéristiques de visage discriminatives similaires pour de mêmes identités données. Les résultats de simulation obtenus avec la competition COX Face DB confirment l’efficacité de la technique FFA-CNN proposée pour obtenir des performances convaincantes par rapport aux systèmes RV de type RNC dans la littérature.
| Date | 27 sept. 2017 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Éric Granger (Directeur(-trice)), Robert Sabourin (Codirecteur(-trice)) & Guillaume Alexandre Bilodeau (Codirecteur(-trice)) |
|---|