Passer à la navigation principale Passer à la recherche Passer au contenu principal

Adaptation of deep siamese neural networks for video face recognition

Traduction de l'intitulé de la thèse: Adaptation de réseaux de neurones profonds siamois pour la reconnaisance de visage dans des vidéo
  • Hugo Lemoine St-André

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Technologie des systèmes

Résumé

La reconnaissance faciale pour des images statiques de visage a été très explorée et généralement avec succès, mais des images vidéo de visages capturés dans des environnements non contraints pose des défis plus difficiles puisque les images souffrent plus de variation de pose, de flou, d’illumination, de basse résolution et de basse qualité. Dans cette thèse, nous adressons la reconnaissance faciale pour des applications vidéo. Premièrement, nous explorons la reidentification faciale pour des applications vidéos en essayant de comparer des paires de visages pour identifier une personne dans une base de données en utilisant un réseau Siamois profond. Après, nous explorons la description vidéo en essayant de capturer la distribution des identités d’un film en utilisant un réseau Siamois avec une technique de catégorisation. Pour adresser ce problème, d’autres recherches utilisent une quantité large de données annotées pour entraîner leurs modèles, ce qui est problématique puisque l’annotation est couteuse en temps et ressources. L’objectif est d’adapter un réseau Siamois profond entrainé avec des bases de données publiques composées d’images statiques de visage à un domaine vidéo non contraint d’une manière non supervisée, ce qui enlèverait la nécessité d’annoter manuellement. À cette fin, nous utilisons triplet-loss pour apprendre et adapter une représentation faciale discriminante d’une manière pratique pour des applications réelles. Des recherches récentes en vidéo surveillance utilisent de l’adaptation supervisé pour réduire l’écart entre les images statiques et vidéos. D’autres recherches utilisent de l’adaptation de domaine faiblement-supervisé ou non supervisé, mais peu utilisent des réseaux Siamois profonds. Ceux-ci requièrent que le domaine ciblé soit un problème avec un nombre de classes prédéterminé ou d’avoir une grande quantité de données non annotées ce qui n’est pas pratique. Dans cette thèse, nous introduisons l’apprentissage par duo de triplet qui est une variante de l’apprentissage par triplet. Nous utilisons simultanément des triplets du domaine source et vidéo pour adapter les représentations robustes d’image statiques à une source vidéo nouvellement installée en utilisant peu de données non annotées. La méthodologie est validée avec la base de donnée COX-S2V où nous obtenons un gain en précision de classification de 3% à 7%. En ce qui concerne la description vidéo, nous utilisons des réseaux Siamois profonds avec l’information de tracklet pour grouper les visages de même identité. Avec un tel outil, il serait possible de décrire des visages de n’importe quel vidéo automatiquement. À cette fin, nous adaptons un CNN robuste de visage statique à un film en utilisant les visages non annotés de ce même film. En utilisant l’information spatio-temporelle de la vidéo, il est possible de produire des pairs de visage pour l’apprentissage par triplet. Avec cela, nous essayons l’apprentissage auto-supervisé avec un réseau Siamois profond, utilisant le premier épisode de la série télévisée The Big Bang Theory, pour apprendre des caractéristiques robustes des visages présents dans le film. Nous démontrons que l’apprentissage auto-supervisé peut améliorer le score de regroupement (mesure V) de 15%. De plus, avec un nombre suffisant de données, les trackets peuvent être utilisés comme représentation simple pour faire du regroupement plus rapidement et précisément.
Date5 oct. 2021
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurÉric Granger (Directeur(-trice)) & Mohamed Dahmane (Codirecteur(-trice))

Mots-clés

  • reconnaissance faciale
  • apprentissage profond
  • réseau Siamois
  • vidéo surveillance
  • vidéo description

Citer cette ressource

'