Passer à la navigation principale Passer à la recherche Passer au contenu principal

Adaptation of deep object detectors for new modalities

Traduction de l'intitulé de la thèse: Adaptation des détecteurs d’objets basés sur l’apprentissage profond à de nouvelles modalités
  • Heitor Rapela Medeiros

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Les performances des détecteurs d’objets profonds se détériorent considérablement lorsqu’ils sont déployés sur différentes modalités de capteurs, telles que le RGB, l’infrarouge et la profondeur. Cette dégradation provient du décalage entre les modalités, qui affecte drastiquement les performances des modèles. Les méthodes d’adaptation existantes, telles que la traduction au niveau des pixels ou l’alignement dans l’espace des caractéristiques, sont souvent limitées à des modalités spécifiques ou nécessitent un réentraînement important, entraînant un coût computationnel élevé et une perte potentielle des connaissances acquises auparavant. Contrairement à l’approche dominante consistant à adapter le modèle, nous explorons ici le potentiel d’adapter l’entrée, ou d’apporter des modifications mineures, afin de préserver autant que possible les connaissances préalables tout en incorporant celles propres à la nouvelle modalité. Dans ce contexte, cette thèse étudie des stratégies d’adaptation de modalités visant à combler l’écart entre les modalités tout en maintenant les performances de détection du modèle RGB préentraîné sur la source. Dans cette thèse, nous présentons d’abord notre démarche et nos contributions. Ensuite, dans le premier chapitre, nous fournissons un cadre général permettant de comprendre les différentes stratégies abordées dans cette thèse, avec divers mécanismes utilisés pour adapter les détecteurs d’objets, allant du niveau d’entrée (modification de l’image) au niveau intermédiaire (mécanismes dans les épines dorsales) et au niveau de sortie (adaptation des boîtes ou modifications pseudoniveau). Dans le deuxième chapitre, nous étudions comment incorporer la connaissance de deux modalités différentes dans un seul encodeur partagé et agnostique à la modalité pour les détecteurs, de manière efficace et performante. Ensuite, dans le troisième chapitre, nous explorons une adaptation progressive des modalités : d’abord, l’adaptation des connaissances du détecteur à partir des données RGB sources (par exemple, le jeu de données COCO) vers un jeu de données RGB cible (par exemple, LLVIP RGB), puis l’adaptation de l’entrée à partir des données infrarouges (par exemple, LLVIP IR) vers une représentation pseudo-RGB à l’aide du retour du détecteur. Dans le quatrième chapitre, nous nous concentrons sur l’adaptation de la modalité au niveau de l’entrée, en préservant les connaissances du modèle préentraîné sur la source (par exemple, COCO) et en l’adaptant directement au jeu de données infrarouges (par exemple, LLVIP IR), sans l’étape intermédiaire du chapitre précédent, tout en cherchant à maximiser la performance de détection et à conserver les capacités zéro-shot de la source. Dans le cinquième chapitre, nous explorons comment intégrer le langage dans l’adaptation de la modalité d’entrée pour les détecteurs d’objets visuel-langage ; notre objectif était donc de préserver la connaissance zéro-shot du détecteur tout en comprenant comment intégrer des techniques puissantes d’adaptation de modalité visuelle, combinées à l’adaptation de prompts. Nos principales contributions incluent : pour le deuxième chapitre, nous introduisons MiPa, une stratégie d’entraînement par patchs mixtes pour les détecteurs d’objets basés sur des transformeurs, permettant à un encodeur partagé d’être agnostique aux modalités RGB et infrarouge. MiPa échantillonne et combine de manière stochastique des patchs complémentaires RGB/IR pendant l’entraînement, capturant efficacement l’information intermodale sans nécessiter les deux modalités à l’inférence. Dans le quatrième chapitre, nous introduisons ModTr, un cadre de traduction de modalités pour adapter les détecteurs d’objets RGB préentraînés à de nouvelles modalités, telles que l’infrarouge (IR), sans modifier les paramètres du détecteur. ModTr préserve les connaissances originales du détecteur, permettant à un seul modèle de gérer plusieurs modalités via des traducteurs dédiés, réduisant ainsi les coûts de mémoire et de calcul. ModTr introduit des stratégies de fusion simples mais efficaces, telles que la fusion basée sur le produit d’Hadamard, pour combiner les entrées traduites et originales. Dans le cinquième chapitre, nous introduisons ModPrompt, un cadre basé sur des prompts visuels pour adapter les détecteurs d’objets à vocabulaire ouvert (OV-OD) à de nouvelles modalités visuelles, telles que l’infrarouge, la profondeur et le LiDAR, sans compromettre leurs capacités zéro-shot. Contrairement aux stratégies de prompts au niveau des pixels utilisées en classification, ModPrompt emploie un module de prompt visuel encodeur-décodeur qui génère des prompts spécifiques à chaque image. Il propose également les Modality Prompt Decoupled Residuals (MPDR), qui améliorent l’adaptation en introduisant des paramètres résiduels légers et compatibles avec l’inférence, permettant un alignement entre modalités sans perte des connaissances langagières préentraînées. Enfin, dans la dernière partie de cette thèse, nous présentons une conclusion générale sur la manière de tirer parti des connaissances RGB préentraînées des détecteurs tout en les adaptant à de nouvelles modalités, ainsi que des recommandations pour les travaux futurs.
Date18 nov. 2025
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurMarco Pedersoli (Directeur(-trice)) & Éric Granger (Codirecteur(-trice))

Mots-clés

  • détection d’objets
  • adaptation de modalités
  • décalage de domaine
  • modèles vision–langage
  • information privilégiée
  • apprentissage inter-modalités

Citer cette ressource

'