Passer à la navigation principale Passer à la recherche Passer au contenu principal

Adaptive multi-classifier systems for face re-identification applications

Traduction de l'intitulé de la thèse: Systèmes multi-classificateur adaptatifs pour la reconnaissance de visage en applications deréidentification
  • Miguel Angel De la Torre Gomora

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Dans la vidéo-surveillance, les systèmes décisionnels reposent de plus en plus sur la reconnaissance de visage (RV) pour déterminer rapidement si les régions faciales capturées sur un réseau de caméras correspondent à des personnes d’intérêt. Les systèmes RV en vidéo-surveillance sont utilisés dans de nombreux scénarios, par exemple pour la détection d’individus sur la liste noire, la ré-identification de visages, et recherche et récupération. Cette thèse se concentre sur la RV vidéo-à-vidéo, où les modèles de visages sont créés avec des données de référence, puis mis à jour avec de nouvelles donées collectées dans des flux vidéo. La reconnaissance d’individus d’intérêt à partir d’images de visages capturées avec des caméras vidéo est une tâche qui représente de nombreux défis. Plus particulièrement, il est souvent supposé que l’aspect du visage des personnes cibles ne change pas au fil du temps, ainsi que les proportions des visages capturés pour des individus cibles et non-cibles sont équivalentes, connues a priori et fixes. Cependant, de nombreuses variations peuvent se manifester dans les conditions d’observation, par exemple l’éclairage, le brouillage, la résolution, l’expression, la pose et l’interopérabilité avec la caméra. De plus, les modèles de visages utilisés pour calculer des correspondances ne sont généralement pas représentatifs car désignés a priori, avec une quantité limitée d’échantillons de référence qui sont collectés et étiquetés à un coût élevé. Enfin, les proportions des individus cibles et non-cibles changent continuellement durant le fonctionnement du système. Dans la littérature, des systèmes adaptatifs multi-classificateur (en anglais, multiple classifier systems, MCS) ont été utilisés avec succès pour la RV vidéo-à-video, où les modèles de visages de chaque individu cible sont générés en utilisant un ensemble de classificateurs à 2-classes (entraînés avec des échantillons cibles et non-cibles). Des approches plus récentes utilisent des ensembles de classificateurs Fuzzy ARTMAP à deux classes, entraîné avec une stratégie DPSO (dynamic particle swarm optimization) pour générer un groupement de classificateurs dont les paramètres sont optimisés, ainsi que la combinaison Booléenne pour la fusion de leur réponses dans l’espace ROC (Receiver Operating Characteristics). Des ensembles actifs de classificateurs sensibles au biais ont été récemment proposés, pour adapter la fonction de fusion d’un ensemble selon le débalancement des classes mesuré sur des données opérationnelles. Ces approches estiment les proportions cibles contre non-cibles périodiquement au cours des opérations. La fusion des ensembles de classificateurs est ensuite adaptée à ce débalancement des classes. Finalement, le suivi du visage peut être utilisé pour regrouper les réponses du système liées à une trajectoire du visage (captures du visage d’une seule personne dans la scène) pour une reconnaissance spatio-temporelle robuste, ainsi que pour mettre à jour les modèles du visage au cours du temps à l’aide des données opérationnelles. Dans cette thèse, des nouvelles techniques sont proposées pour adapter les modèles de visages pour des individus enrôlés dans un système de RV vidéo-à-vidéo. L’utilisation de stratégies d’auto-mise à jour basées sur l’utilisation de trajectoires est proposée pour mettre à jour le système, en considérant les changements brusques et progressifs dans l’environnement de classification. Ensuite, des classificateurs adaptatifs sensibles au biais sont proposés pour l’adaptation du système au débalancement des classes lors de la phase opérationnelle. Dans le chapitre 2, un cadre adaptatif est proposé pour l’apprentissage partiellement supervisé des modèles de visages au fil du temps en fonction des trajectoires capturées. Lors des opérations, des informations recueillies à l’aide d’un suivi de visages et des ensembles de classificateurs spécifiques à l’individu sont intégrés pour la reconnaissance spatio-temporelle robuste et l’auto-mise à jour des modèles du visage. Le suiveur définit une trajectoire de visage pour chaque personne qui apparaît dans une vidéo. La reconnaissance d’un individu cible passe si les prédictions positives accumulées d’une trajectoire dépassent un seuil de détection pour un ensemble. Lorsque le nombre de prédictions positives dépassent un seuil de mise à jour, tous les échantillons du visage de la cible de la trajectoire sont combinés avec des échantillons non-cibles (choisi parmi le modèle cohorte et le modèle universel) pour mettre à jour le modèle du visage correspondant. Une stratégie learn-and-combine est utilisée pour éviter la corruption de la connaissance lors de l’auto-mise à jour des ensembles. En outre, une stratégie de gestion de la mémoire basée sur la divergence Kullback-Leibler est proposée pour ordonner et sélectionner des échantillons de référence cible et non-cible les plus pertinents. Ensuite, les échantillons choisis sont stockés dans la mémoire alors que les ensembles évoluent. Pour une preuve de concept, le système proposé a été validé avec des données synthétiques et vidéos de la base de données Face in Action, émulant un scénario de vérification passeport. Les résultats mettent en valeur la réponse des systèmes proposés à des changements graduels et brusques dans l’apparence des visages des individus, tels que l’on trouve dans la vidéo-surveillance, dans des conditions semi-contrôlées ou non contrôlées de capture. Initialement, les trajectoires capturées à partir de vidéos de référence sont utilisées pour l’apprentissage supervisé des ensembles. Ensuite, des vidéos de plusieurs scénarios opérationnels ont été présentés au système, qui a été automatiquement mis-à-jour avec des trajectoires de haut niveau de confiance. Une analyse des résultats image par image avec des données réelles montre que l’approche proposée surpasse les systèmes de référence qui ne s’adaptent pas aux nouvelles trajectoires. De plus, le système proposé offre des performances comparables à des systèmes idéaux qui s’adaptent à toutes les trajectoires cibles concernées, à travers l’apprentissage supervisé. Une analyse par individu révèle la présence d’individus particuliers, pour lesquels les ensembles automatiquement mis à jour avec les trajectoires de visages sans étiquette présentent un avantage considérable. Enfin, une analyse au niveau des trajectoires révèle que le système proposé permet une RV vidéo-à-vidéo robuste. Dans le chapitre 3, une extension et une mise en oeuvre particulière du système de RV spatiotemporelle utilisant des ensembles est proposée, et il est caractérisé en scénarios avec des changements progressifs et brusques dans l’environnement de classification. L’analyse des résultats image par image montrent que le système proposé permet d’augmenter la précision AUC (surface sous la courbe ROC) d’environ 3 % dans les scénarios avec des changements brusques, et d’environ 5 % dans les scénarios avec des changements graduels. Une analyse par sujet révèle les limitations de la reconnaissance de visage avec des variations de pose, affectant plus de façon significative les individus de type agneaux et chèvre. Par rapport à des approches de fusion spatio-temporelle de référence, les résultats montrent que l’approche proposé présente une meilleure capacité de discrimination. Dans le chapitre 4, des ensembles adaptatifs sont proposés pour combiner des classificateurs entraînés avec des niveaux de débalancement et complexité variables pour améliorer la performance dans la RV vidéo-à-video. Lors des opérations, le niveau de débalancement est périodiquement estimé à partir des trajectoires d’entrée utilisant la méthode de quantification HDx, et des représentations d’histogrammes pré-calculés de la distribution des données débalancées. Les réponses des ensembles sont accumulées pour la reconnaissance vidéo-à-vidéo sensible au débalancement. Les résultats sur les données synthétiques montrent qu’en utilisant l’approche proposée, on observe une amélioration significative de la performance. Les résultats sur des données réelles montrent que la méthode proposée surpasse la performance des techniques de référence dans des environnements de surveillance vidéo.
Date26 janv. 2015
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurÉric Granger (Directeur(-trice)) & Robert Sabourin (Codirecteur(-trice))

Mots-clés

  • Reconnaissance des visages (Informatique) Systèmes adaptatifs (Informatique) Apprentissage supervisé (Intelligence artificielle) Vidéosurveillance. systèmes multi-classificateur
  • reconnaissance adaptatif de visages
  • apprentissage semi-supervisé
  • combinaison sensible au biais
  • débalancement de classes

Citer cette ressource

'