Passer à la navigation principale Passer à la recherche Passer au contenu principal

Multi-target domain adaptation for person re-identification

Traduction de l'intitulé de la thèse: Adaptation de domaine à cible multiple pour la réidentification de personnes
  • Félix Remigereau

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie électrique

Résumé

La ré-identification de personnes (ReID) consiste à faire correspondre des images de piétons capturées par un réseau de caméras multiples qui ne partagent pas les conditions de capture et dont les champs de vision ne s’entrecroisent pas. À partir d’une image de requête, dites "query", capturée pour un individu, le système doit automatiquement trouver toutes les autres images du même individu dans une galerie d’images de piétons. Plusieurs facteurs rendent cette tâche difficile, tels que la différence entre les points de vue des caméras, les occlusions visuelles, la pose du piéton et les variations d’éclairage de la scène. Ce domaine de recherche a des applications importantes dans l’automatisation de la surveillance vidéo et de la biométrie. Les progrès récents en matière d’apprentissage profond et la disponibilité de grandes bases de données annotées ont permis aux systèmes modernes de s’entraîner efficacement et d’atteindre un niveau de précision très élevé. Si ces solutions fonctionnent bien avec suffisamment de données d’entraînement capturées pour un réseau de caméras donné, également connu sous le nom de "domaine", les performances chutent de manière significative lors du traitement d’images provenant d’un autre domaine opérationnel. Dans l’application d’un système ReID, nous considérons deux types de données : les données sources provenant d’un environnement contrôlé et étiqueté, et les données cibles, généralement non étiquetées, provenant du domaine opérationnel dans lequel le système est déployé. En effet, les différents domaines divergent en raison de leurs caractéristiques différentes, telles que la position de la caméra, la résolution de l’image, l’éclairage et l’arrière-plan, pour n’en citer que quelques-unes. Étant donné que le coût de génération d’un nouvel ensemble de données étiquetées pour chaque nouveau domaine opérationnel est très élevé, des techniques d’adaptation de domaine non supervisée (UDA) ont été développées pour exploiter un ensemble de données source étiqueté et des ensembles de données cibles non étiquetés afin de maximiser la performance sur les données opérationnelles. Cependant, un autre problème se pose lorsque plusieurs domaines cibles sont présents. Chaque domaine cible diverge dans ses caractéristiques spécifiques et nécessite une adaptation unique. L’adaptation d’un modèle ReID personnalisé pour chaque domaine cible est une solution simple mais peu pratique dans les applications réelles où les ressources informatiques sont limitées. D’autre part, l’apprentissage d’un modèle unique sur toutes les cibles simultanément peut réduire la précision en raison de la capacité insuffisante du modèle, lorsqu’il s’agit de données très variées. La solution optimale doit donc offrir une grande précision sur chaque cible tout en minimisant la complexité de la mémoire du modèle résultant. Très peu de recherches s’intéressent aux méthodes d’adaptation de domaines non supervisée multi-cibles (MTDA) pour la ReID. Ces méthodes sont souvent peu précises et ne prennent pas en compte la complexité de la solution lors de l’évaluation. Le succès d’un système dépend des données utilisées, de la capacité du CNN et de la méthode MTDA employée. Il est donc essentiel de prendre en compte la complexité du CNN entraîné ainsi que les ensembles de données utilisés lors de l’évaluation d’une méthode MTDA. Ce travail aborde le problème du MTDA pour l’identification des personnes à l’aide de la distillation des connaissances (KD). L’objectif est d’entraîner un modèle CNN compact capable de faire correspondre deux images de piétons capturées par des caméras différentes. Le modèle de Deep Learning (DL) sera capable d’effectuer cette tâche sur des images provenant de plusieurs domaines cibles. Nous évaluons la solution en fonction de (1) la précision du modèle lorsqu’il est entraîné pour de nombreux domaines cibles, et (2) le temps d’inférence et le nombre de paramètres du modèle au moment de l’inférence. Dans cette thèse, nous présentons deux contributions principales liées à ces critères. La première contribution, présentée au Chapitre 4, est le développement d’une technique MTDA basée sur KD pour la ReID de personnes, intitulée KD-ReID. À l’aide d’une fonction de coût spécialement conçue pour la ReID, nous adaptons un ensemble de modèles CNN "teacher", chacun à un domaine cible spécifique, puis nous distillons les connaissances dans un seul modèle CNN "student". Le modèle résultant est précis pour tous les domaines cibles tout en restant peu coûteux pour une application réelle. Nous montrons que cette approche est plus performante que les approches de pointe existantes en termes de précision et de complexité du modèle. En outre, nous montrons que KD-ReID est très flexible, permettant d’utiliser des modèles d’enseignants d’architecture et de techniques d’apprentissage différentes. Cette flexibilité renforce le potentiel de KD-ReID à être utilisé dans des applications réelles. Cette contribution a été acceptée et publiée dans l’IEEE International Conference on Image Processing 2022 (ICIP2022). Notre deuxième contribution, présentée au Chapitre 5, est une étude comparative complète des techniques KD-MTDA, afin de maximiser le rapport entre la complexité du système et la précision pour la tâche ReID. À l’aide d’un modèle compact, nous adaptons diverses techniques à notre problème MTDA. Plus précisément, nous analysons et comparons quatre techniques : les couches de BN spécifiques à un domaine, le modèle multi-branches, les adaptateurs de domaine et les adaptateurs de distillation. Les techniques étudiées visent à augmenter la précision sur des cibles multiples au prix d’une augmentation du nombre de paramètres du modèle. En plus de permettre l’optimisation de notre solution dans une situation de ressources limitées, cette étude nous permet de tirer des conclusions importantes sur le compromis entre la précision des méthodes MTDA spécialisées pour notre tâche.
Date8 août 2023
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurÉric Granger (Directeur(-trice)) & Rafael Menelau Oliveira Cruz (Codirecteur(-trice))

Mots-clés

  • video-surveillance
  • distillation de connaissance
  • adaptation de domaine à cible multiple
  • ré-identification de personnes
  • adapteur de domaines
  • normalisation de batch

Citer cette ressource

'