Passer à la navigation principale Passer à la recherche Passer au contenu principal

Dealing with domain shift in deep learning: from training-time generalization to test-time adaptation

Traduction de l'intitulé de la thèse: Gérer le décalage de domaine en apprentissage profond : de la généralisation à l’entraînement à l’adaptation au temps d’inférence
  • Mehrdad Noori

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Les modèles d’apprentissage profond ont connu des avancées remarquables dans un large éventail de tâches de vision par ordinateur, allant de la classification d’images à la détection d’objets et à la segmentation. Malgré ces progrès, la plupart de ces modèles sont conçus sous l’hypothèse simplificatrice que les données rencontrées lors du déploiement suivront une distribution similaire à celle observée pendant l’entraînement. Dans la pratique, cette hypothèse est rarement vérifiée. Les conditions réelles — telles que les variations d’éclairage, de capteurs, de points de vue ou de textures — peuvent modifier considérablement la distribution des données et entraîner une chute notable des performances. Cette vulnérabilité soulève des préoccupations majeures quant à la robustesse et à la fiabilité des systèmes de vision déployés dans des environnements non contrôlés. Pour pallier cette limitation, cette thèse explore des approches allant au-delà du paradigme classique centré sur l’entraînement, afin de concevoir des modèles capables de maintenir leurs performances face à des conditions nouvelles et imprévues. Plus précisément, elle étudie deux directions : la Généralisation de Domaine (DG), qui vise à apprendre des représentations invariantes aux domaines durant l’entraînement, et l’Adaptation au Temps d’Inférence (TTA), qui permet aux modèles de s’ajuster dynamiquement lors de l’inférence à partir de données tests non étiquetées. Ensemble, ces approches répondent au besoin croissant de modèles fiables et adaptatifs, tant pour les architectures visuelles classiques que pour les modèles fondamentaux modernes tels que les systèmes vision–langage. Dans la première partie, nous étudions la DG et proposons deux méthodes novatrices. (1)TFS-ViT (Token-Level Feature Stylization for Vision Transformers) introduit le premier cadre de stylisation de caractéristiques au niveau des tokens pour les Vision Transformers, en mélangeant les statistiques de normalisation entre échantillons afin de favoriser des représentations dépendantes de la structure plutôt que de la texture. Une variante sensible à l’attention exploite les cartes d’attention du jeton de classe pour orienter la stylisation vers les régions sémantiquement pertinentes, atteignant des performances de pointe sur les principaux jeux de données de DG. (2) FDS (Feedback-Guided Domain Synthesis) présente un cadre fondé sur la diffusion qui entraîne un modèle conditionnel multi-source unique capable de générer des pseudo-domaines couvrant les écarts inter-domaines. Un mécanisme de filtrage guidé par la rétroaction sélectionne les échantillons synthétiques les plus difficiles afin de promouvoir explicitement l’apprentissage de caractéristiques invariantes aux domaines, tout en évitant tout coût de génération lors de l’inférence. Avec l’émergence de modèles fondamentaux à grande échelle, préentraînés une seule fois puis réutilisés pour une multitude de tâches, il devient crucial de concevoir des mécanismes d’adaptation capables d’opérer au moment de l’inférence sans accès aux données sources. Cela motive la deuxième partie de cette thèse, consacrée aux stratégies d’adaptation entièrement au temps d’inférence pour les Modèles Vision–Langage (VLMs). (3) MLMP constitue le premier cadre TTA pour la segmentation sémantique à vocabulaire ouvert (OVSS), combinant une fusion adaptative multi-couches à une optimisation multi-prompt afin d’exploiter la sensibilité intrinsèque des VLMs aux prompts comme signal stable d’adaptation. Nous établissons également le premier benchmark complet pour l’OVSS-TTA, couvrant neuf ensembles de données et plus de quatre-vingts scénarios de test, fournissant ainsi un protocole standardisé pour les recherches futures. (4) Histopath-C introduit le premier benchmark d’évaluation de l’adaptation TTA des VLMs en histopathologie numérique, simulant des décalages de domaine cliniquement réalistes tels que les variations de coloration, le flou et la contamination. Ce cadre constitue une base solide pour l’étude de la robustesse des modèles en contexte médical. S’appuyant sur ce benchmark, nous proposons également LATTE (Low-rank Adaptation with Transductive Template Ensembling), une stratégie d’adaptation simple mais efficace combinant plusieurs gabarits textuels à des mises à jour de faible rang pour améliorer la stabilité et la robustesse du modèle. Spécifiquement conçue pour l’histopathologie, cette méthode offre des gains de performance significatifs sur divers ensembles de données et représente l’une des applications les plus réalistes et pertinentes de l’adaptation au temps d’inférence.
Date4 mars 2026
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurChristian Desrosiers (Directeur(-trice)) & Ismail Ben Ayed (Codirecteur(-trice))

Mots-clés

  • généralisation de domaine
  • adaptation au temps d’inférence
  • modèles vision–langage

Citer cette ressource

'