Les modèles d’apprentissage profond ont connu un succès remarquable dans un large éventail de tâches de vision par ordinateur, allant de la classification à la segmentation, et au-delà. Cependant, ces modèles sont souvent entraînés sous l’hypothèse que les données rencontrées lors de l’inférence proviendront de la même distribution que celles du jeu de données d’entraînement. Dans des scénarios réels, cette hypothèse est rarement vérifiée. Même de subtiles variations dans l’éclairage, les propriétés des caméras, les textures de fond ou l’apparence des objets peuvent entraîner des décalages importants dans la distribution des données, ce qui se traduit par une chute brusque des performances du modèle. Cette vulnérabilité aux changements de distribution soulève des préoccupations majeures quant à la robustesse et à la fiabilité des systèmes de vision déployés dans le monde réel.
Contrairement aux réseaux de neurones profonds, la perception humaine fait preuve d’une résilience naturelle face à de tels changements. Nous reconnaissons les personnes et les objets dans des conditions variées sans avoir besoin de réentraîner ou de superviser explicitement, guidés par des indices contextuels et des connaissances générales. Inspirée par cela, cette thèse déplace son attention du paradigme traditionnel centré sur l’entraînement vers une approche centrée sur l’inférence, où les modèles ne sont pas réentraînés ou ajustés hors ligne, mais s’adaptent dynamiquement et de manière non supervisée au moment de l’inférence. Ce cadre, couramment appelé Adaptation au Temps d’Inférence (Test Time Adaptation–TTA), présente des défis uniques, tels que l’absence de données étiquetées, l’inaccessibilité des données d’entraînement sources en raison de contraintes de confidentialité ou de stockage, et la nécessité d’une adaptation rapide et en temps réel.
Pour relever ces défis, cette thèse présente une série de méthodes modulaires et indépendantes de l’architecture pour adapter les modèles de vision pendant l’inférence, en mettant l’accent sur la robustesse, l’efficacité computationnelle et la large applicabilité.
En première contribution, nous introduisons NC-TTT : un cadriciel d’entraînement contrastif au temps d’évaluation, adapté aux réseaux de neurones convolutifs. Plutôt que de minimiser l’entropie ou de mettre à jour les statistiques de lot, notre méthode repose sur une tâche contrastive auxiliaire qui apprend à distinguer les augmentations bruitée des représentations de caractéristiques. Cela permet au modèle de renforcer sa compréhension des caractéristiques appartenant à la distribution tout en supprimant le bruit hors distribution, sans étiquettes ni accès aux données sources. NC-TTT démontre de solides performances sous divers types de changements à la distribution, notamment les entrées corrompues ainsi que les différences entre les domaines synthétiques et réels.
Dans la deuxième contribution, nous étendons l’adaptation au temps d’évaluation aux Modèles Vision-Langage (MLV), en particulier CLIP, qui a gagné en popularité grâce à ses capacités de faire des prédictions pour des nouvelles classes (zero-shot). Nous introduisons CLIPArTT, une méthode qui exploite la compositionnalité inhérente au langage pour adapter les invites textuelles (text prompts) au moment de l’évaluation. Plutôt que d’utiliser des invites fixes et préétablies, nous proposons une stratégie pour construire dynamiquement des invites en utilisant les propres prédictions top-K du modèle et les scores de similarité multi-modaux. Cette adaptation guidée par pseudo-étiquettes permet à CLIP de réaligner ses prédictions avec les distributions cibles, améliorant ainsi la précision de classification sur divers ensembles de données corrompus et décalés de domaine.
Notre troisième contribution principale explore le potentiel de l’adaptation multi-modèle dans les MVL à travers une méthode appelée WATT (Weight Averaged Test-Time Adaptation). Ici, nous adaptons CLIP à la distribution cible en utilisant plusieurs modèles textuels divers, chacun représentant une formulation linguistique différente des classes. Plutôt que de sélectionner un seul meilleur modèle, nous agrégeons les poids du modèle appris en utilisant une stratégie d’agrégation par moyenne des poids. Le résultat est un modèle plus stable et généralisable qui exploite la diversité des invites tout en évitant le sur-apprentissage de toute perspective linguistique unique.
Ensemble, ces contributions forment une approche cohérente et prospective pour construire des modèles de vision robustes, adaptatifs et prêts pour le déploiement. En minimisant la dépendance aux données étiquetées et à l’accès au domaine source, et en privilégiant la modularité et la flexibilité architecturale, cette thèse ouvre la voie à une nouvelle génération de systèmes intelligents qui apprennent non seulement pendant l’entraînement, mais évoluent également continuellement pendant l’inférence.
| Date | 15 sept. 2025 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Christian Desrosiers (Directeur(-trice)) & Ismail Ben Ayed (Codirecteur(-trice)) |
|---|
- adaptation au temps d’inférence
- entrainement au temps d’inférence
- changement de distribution
- modèles vision-langage
Osowiechi, D. (Auteur(e)),
Desrosiers (Directeur(-trice)) &
Ben Ayed (Codirecteur(-trice)),
15 sept. 2025Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie