Les modèles d’apprentissage profond ont connu des avancées remarquables dans un large éventail de tâches de vision par ordinateur, allant de la classification d’images à la détection d’objets et à la segmentation. Malgré ces progrès, la plupart de ces modèles sont conçus sous l’hypothèse simplificatrice que les données rencontrées lors du déploiement suivront une distribution similaire à celle observée pendant l’entraînement. Dans la pratique, cette hypothèse est rarement vérifiée. Les conditions réelles — telles que les variations d’éclairage, de capteurs, de points de vue ou de textures — peuvent modifier considérablement la distribution des données et entraîner une chute notable des performances. Cette vulnérabilité soulève des préoccupations majeures quant à la robustesse et à la fiabilité des systèmes de vision déployés dans des environnements non contrôlés.
Pour pallier cette limitation, cette thèse explore des approches allant au-delà du paradigme classique centré sur l’entraînement, afin de concevoir des modèles capables de maintenir leurs performances face à des conditions nouvelles et imprévues. Plus précisément, elle étudie deux directions : la Généralisation de Domaine (DG), qui vise à apprendre des représentations invariantes aux domaines durant l’entraînement, et l’Adaptation au Temps d’Inférence (TTA), qui permet aux modèles de s’ajuster dynamiquement lors de l’inférence à partir de données tests non étiquetées. Ensemble, ces approches répondent au besoin croissant de modèles fiables et adaptatifs, tant pour les architectures visuelles classiques que pour les modèles fondamentaux modernes tels que les systèmes vision–langage.
Dans la première partie, nous étudions la DG et proposons deux méthodes novatrices. (1)TFS-ViT (Token-Level Feature Stylization for Vision Transformers) introduit le premier cadre de stylisation de caractéristiques au niveau des tokens pour les Vision Transformers, en mélangeant les statistiques de normalisation entre échantillons afin de favoriser des représentations dépendantes de la structure plutôt que de la texture. Une variante sensible à l’attention exploite les cartes d’attention du jeton de classe pour orienter la stylisation vers les régions sémantiquement pertinentes, atteignant des performances de pointe sur les principaux jeux de données de DG. (2) FDS (Feedback-Guided Domain Synthesis) présente un cadre fondé sur la diffusion qui entraîne un modèle conditionnel multi-source unique capable de générer des pseudo-domaines couvrant les écarts inter-domaines. Un mécanisme de filtrage guidé par la rétroaction sélectionne les échantillons synthétiques les plus difficiles afin de promouvoir explicitement l’apprentissage de caractéristiques invariantes aux domaines, tout en évitant tout coût de génération lors de l’inférence.
Avec l’émergence de modèles fondamentaux à grande échelle, préentraînés une seule fois puis réutilisés pour une multitude de tâches, il devient crucial de concevoir des mécanismes d’adaptation capables d’opérer au moment de l’inférence sans accès aux données sources. Cela motive la deuxième partie de cette thèse, consacrée aux stratégies d’adaptation entièrement au temps d’inférence pour les Modèles Vision–Langage (VLMs). (3) MLMP constitue le premier cadre TTA pour la segmentation sémantique à vocabulaire ouvert (OVSS), combinant une fusion adaptative multi-couches à une optimisation multi-prompt afin d’exploiter la sensibilité intrinsèque des VLMs aux prompts comme signal stable d’adaptation. Nous établissons également le premier benchmark complet pour l’OVSS-TTA, couvrant neuf ensembles de données et plus de quatre-vingts scénarios de test, fournissant ainsi un protocole standardisé pour les recherches futures.
(4) Histopath-C introduit le premier benchmark d’évaluation de l’adaptation TTA des VLMs en histopathologie numérique, simulant des décalages de domaine cliniquement réalistes tels que les variations de coloration, le flou et la contamination. Ce cadre constitue une base solide pour l’étude de la robustesse des modèles en contexte médical. S’appuyant sur ce benchmark, nous proposons également LATTE (Low-rank Adaptation with Transductive Template Ensembling), une stratégie d’adaptation simple mais efficace combinant plusieurs gabarits textuels à des mises à jour de faible rang pour améliorer la stabilité et la robustesse du modèle. Spécifiquement conçue pour l’histopathologie, cette méthode offre des gains de performance significatifs sur divers ensembles de données et représente l’une des applications les plus réalistes et pertinentes de l’adaptation au temps d’inférence.
| Date | 4 mars 2026 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Christian Desrosiers (Directeur(-trice)) & Ismail Ben Ayed (Codirecteur(-trice)) |
|---|
- généralisation de domaine
- adaptation au temps d’inférence
- modèles vision–langage
Noori, M. (Auteur(e)),
Desrosiers (Directeur(-trice)) &
Ben Ayed (Codirecteur(-trice)),
4 mars 2026Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie