Passer à la navigation principale Passer à la recherche Passer au contenu principal

Metric learning with siamese networks for re-identification and tracking

Traduction de l'intitulé de la thèse: Apprentissage métrique avec des réseaux siamois pour la ré-identification et le suivi
  • Madhu Kiran

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Le suivi d’objets visuels (VOT) et la réidentification de personnes (ReID) sont essentiels pour une large gamme de surveillances et de suivis vidéo, tels que le suivi de cibles multi-caméras, le suivi de piétons pour la conduite autonome, le contrôle d’accès biométrique, etc. Une fois une personne détectée, le VOT produit des cadres englobants continus pour cette personne sur une séquence vidéo à partir d’un emplacement initial. Parallèlement, le ReID identifie les traces perdues d’une personne ou reconnaît des personnes ou objets observés à travers différentes caméras. Ils rencontrent des défis communs, notamment dans les scénarios avec occlusion et changements d’apparence de la cible. Les objectifs d’apprentissage pour le suivi et le ReID sont similaires aux tâches de correspondance de similarités utilisant des architectures de réseaux Siamese. La mise à jour d’un traceur est effectuée en ligne car l’apparence de l’objet ou le prototype doit être appris au fil du temps avec les changements d’apparence. Le ReID n’implique pas d’apprentissage en ligne explicite; il s’agit plutôt d’utiliser des séquences vidéo pour représenter au mieux un objet et le faire correspondre à une base de données d’objets. Les défis liés à l’apprentissage en ligne dans le suivi, où des méthodes comme les approches classiques ou les méthodes de réseau neuronal convolutif profond (CNN) visent à apprendre l’apparence de la cible pendant le suivi pour éviter la dérive de la cible au fil du temps. Cependant, l’adaptation du modèle à l’aide d’échantillons d’un traceur peut être entravée par le bruit introduit par la dérive. Détecter et gérer les dérives devient crucial, et une sélection inappropriée des échantillons peut affecter la robustesse du modèle. Par exemple, une diversité inadéquate dans les échantillons de formation lors de l’adaptation peut entraîner une dérive significative du modèle lorsque l’apparence de la cible change en raison de variations, par exemple, de l’éclairage et du point de vue. Dans la ReID de personnes basée sur la vidéo, l’utilisation de tracklets de personnes dans les requêtes peut relever des défis tels que l’occlusion, le positionnement inexact des cadres englobants, et les variations d’apparence dues aux changements d’éclairage et de point de vue. Des améliorations sont recherchées dans les méthodes d’agrégation de caractéristiques pour les séquences vidéo, en tenant compte des limites de la longueur des séquences et du risque de surajustement. L’occlusion pose un défi important dans l’apprentissage en ligne pour le suivi et le ReID de personnes, amenant les extracteurs de caractéristiques à se concentrer sur des régions non-objectives, conduisant à des correspondances erronées. Développer des solutions efficaces du point de vue computationnel pour gérer l’occlusion est crucial pour les applications en temps réel. Cette thèse se concentre sur trois problèmes principaux : l’apprentissage en ligne avec sélection dynamique de modèles/échantillons pour le suivi, la représentation vidéo et l’apprentissage de représentations conscientes de l’occlusion. La première contribution de cette thèse se concentre principalement sur l’amélioration de l’apprentissage en ligne dans les modèles VOT, avec un accent particulier sur les défis liés à la dérive conceptuelle et à l’occlusion. La dérive conceptuelle englobe les changements dans l’apparence de l’objet suivi, catégorisés comme graduels, abrupts et récurrents. Notre recherche souligne les avantages de l’adaptabilité de la dérive conceptuelle graduelle tout en reconnaissant que les changements abrupts résultent souvent de distractions comme l’occlusion, nécessitant une gestion prudente des mises à jour du modèle. De plus, les dérives récurrentes se produisent lorsque l’apparence précédente de l’objet se reproduit, et nous avons constaté qu’il est efficace de maintenir un tampon d’échantillons à haute variance pour le suivi en ligne. La deuxième contribution de cette thèse se concentre sur la ReID de personnes dans l’analyse vidéo et la surveillance, visant à surmonter les limitations existantes telles que l’apparence changeante, la variation de point de vue à travers les caméras, et l’occlusion. Pour y remédier, incorporez les motifs de mouvement des individus comme indice supplémentaire pour le ReID. Notre solution proposée introduit le réseau d’Attention Mutuelle Guidée par le Flux, fusionnant les séquences de cadres englobants et de flux optique sur des tracklets. Ceci utilise un backbone CNN 2D pour coder à la fois les informations d’apparence temporelle et spatiale. De plus, nous présentons une méthode novatrice pour agréger les caractéristiques à partir de flux d’entrée étendus pour améliorer la représentation au niveau de la séquence vidéo. Les résultats expérimentaux montrent une amélioration significative de la précision du ReID par rapport aux réseaux d’attention traditionnels et aux méthodes actuelles de pointe dans le ReID de personnes basé sur la vidéo. Cette recherche met en évidence le potentiel des mécanismes d’attention guidés par des motifs de mouvement pour améliorer les capacités des modèles d’apprentissage profond pour des applications robustes de ReID vidéo. Notre prochaine introduction concerne un modèle étudiant-enseignant Holistique-Génératif (HG) conçu pour le ReID de personnes occlues, éliminant le besoin d’étiquettes d’identité d’image et de processus intensifs en ressources axés uniquement sur les parties visibles des régions occlues. L’enseignant HG proposé utilise la Distribution de Classe Discriminative (DCD) à travers des échantillons dans un ensemble de données complet pour former un modèle étudiant, permettant la génération de cartes d’attention et abordant les défis posés par l’occlusion. Contrairement aux approches prévalentes dans la littérature qui utilisent une supervision externe comme la pose pour des indices de visibilité, notre méthode repose sur la distribution holistique des données pendant l’entraînement, la traitant comme une étiquette douce. Par conséquent, lors des tests, notre modèle fonctionne sans problème sans avoir besoin d’indices externes comme la pose, avec les paramètres globaux comprenant uniquement l’encodeur de base et un embedding compact pour la génération de cartes d’attention lors de l’extraction de caractéristiques. De plus, l’apprentissage conjoint d’un autoencodeur de débruitage améliore la capacité du modèle à se régénérer de l’occlusion. Les évaluations empiriques sur des ensembles de données divers et difficiles démontrent la performance supérieure de notre méthodologie HG, surpassant les modèles de pointe dans les tâches Occluded-ReID et Holistic ReID. Notre dernière contribution explore l’espace pour la dissimilarité dans le ReID de personnes afin de résoudre le problème de chevauchement entre les classes causé par des modèles efficaces sur le plan computationnel avec des capacités relativement plus petites et des données d’entraînement limitées. Nous proposons d’appliquer une transformation de dichotomie à l’espace des caractéristiques et de classer les paires d’échantillons comme similaires ou dissimilaires avec un classificateur à marge maximale. L’apprentissage de bout en bout d’un classificateur dans l’espace de la dissimilarité a été observé pour améliorer la précision de récupération pour les tâches de ReID de personnes. Les résultats de cette thèse indiquent qu’un apprentissage en ligne efficace avec une sélection soignée des échantillons basée sur des techniques de détection de dérive peut permettre un suivi à long terme avec des mises à jour minimales du traceur, entraînant ainsi une faible complexité globale. De plus, il a également été démontré qu’une bonne représentation peut être apprise en choisissant de longues séquences vidéo. L’occlusion représente un défi dans les applications de suivi et de ReID. Il a été démontré qu’avec un apprentissage conscient de l’occlusion, il peut y avoir une amélioration globale à la fois des performances de suivi et de ReID. Cela résout ce problème pour le scénario pratique avec des données étiquetées minimales d’occlusion.
Date12 sept. 2024
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurÉric Granger (Directeur(-trice)) & Rafael Menelau Oliveira Cruz (Codirecteur(-trice))

Mots-clés

  • suivi d’objets visuels
  • réidentification de personnes
  • apprentissage en ligne
  • apprentissage conscient de l’occlusion
  • réseaux siamois
  • flux optique
  • espace de dissimilarité

Citer cette ressource

'