Passer à la navigation principale Passer à la recherche Passer au contenu principal

Transductive few-shot learning

Traduction de l'intitulé de la thèse: Apprentissage few-shot par transduction
  • Malik Boudiaf

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Les modèles d’apprentissage profond ont connu un succès sans précédent, atteignant des performances proches de celles des humains lorsqu’ils sont entraînés sur des données étiquetées à grande échelle. Cependant, la capacité de généralisation de ces modèles peut être sérieusement remise en question lorsqu’il s’agit de traiter de nouvelles classes (non vues), avec seulement quelques instances étiquetées par classe. Les humains, en revanche, peuvent apprendre de nouvelles tâches rapidement à partir d’une poignée d’exemples, en exploitant le contexte et les connaissances préalables. Pour combler cet écart, la communauté en apprentissage automatique a développé au fil des années, des stratégies de méta-entraînement, dans le but de doter le modèle de capacités de généralisation intrinsèques. Dans cette thèse, nous abordons le problème de l’apprentissage en quelques exemples sous un angle différent. Exploitant les opportunités qui émergent des modèles de fondation, ces grands modèles pré-entraînés une fois sur des ensembles de données comprenant des milliards d’exemples, nous transitionnons d’un paradigme centré sur l’entraînement à un paradigme centré sur l’inférence. Au travers de cette thèse, notre objectif est de développer des procédures d’inférence modulaires qui peuvent adapter efficacement n’importe quel modèle, indépendamment de son architecture ou de sa méthode d’entraînement, à des tâches d’apprentissage avec quelques exemples seulement. Pour accomplir cette tâche difficile, nous explorons les avantages et les limites de la transduction en tant que principe d’inférence, démontrant ainsi des résultats prometteurs sur des tâches de classification et de segmentation en quelques exemples. En tant que première contribution, nous abordons la tâche courante de classification d’images en quelques exemples. Nous développons une procédure d’inférence transductive hautement modulaire, basée sur la maximisation de l’information mutuelle entre les caractéristiques extraites et les prédictions d’étiquettes. Nous observons des résultats très prometteurs, tant sur les benchmark expérimentaux usuels de l’apprentissage en quelques exemples que sur les benchmark présentant des écarts de domaine. En tant que seconde contribution, nous explorons l’impact sur les méthodes transductives de l’introduction d’un déséquilibre de classes dans les données de test non étiquetées de chaque tâche. Nos résultats démontrent de forts effets indésirables pour toutes les méthodes transductives, conduisant certaines à sous-performer par rapport aux méthodes inductives de référence. Pour faire face à ce problème, nous diagnostiquons et étendons la procédure d’inférence basée sur l’information mutuelle décrite précédemment avec des divergences a, dont les gradients permettent une plus grande déviation de la distribution uniforme codée dans l’information mutuelle. Sur le plan empirique, nous observons des gains substantiels dans le scénario de déséquilibre de classes. En tant que troisième contribution, nous continuons à explorer les propriétés potentiellement nuisibles des données non étiquetées sur les méthodes transductives. En particulier, nous étudions le problème d’open-set, dans lequel des classes perturbatrices peuvent être introduites dans les données non étiquetées. Motivés par l’observation que les méthodes transductives existantes présentent de mauvaises performances dans les scénarios d’open-set, nous proposons une généralisation du principe du maximum de vraisemblance, dans laquelle des scores latents réduisant l’influence des valeurs aberrantes potentielles sont introduits aux côtés du modèle paramétrique habituel. Nous montrons que cette méthode surpasse les méthodes inductives et transductives existantes sur les deux aspects de la reconnaissance open-set, à savoir la classification et la détection des valeurs aberrantes. En guise de contribution finale, nous nous penchons sur la tâche difficile de la segmentation en quelques exemples, qui se caractérise par la présence combinée de tous les effets néfastes mentionnés ci-dessus: déséquilibre de classes et open-set. Nous présentons la première méthode qui abandonne complètement le méta-apprentissage et les architectures customisées. A la place, notre méthode utilise un modèle profond standard, entraîné par entropie croisée, et se concentre sur la formulation d’une inférence transductive par image pour chaque nouvelle tâche. Au-delà de la simplicité, nous trouvons que cette nouvelle approche de la segmentation en quelques exemples présente de forts avantages, notamment une capacité considérablement améliorée à exploiter une quantité croissante de supervision, dépassant de 6 % le précédent état de l’art en mIoU dans le scénario à 10 exemples, sur le benchmark le plus populaire.
Date26 avr. 2023
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurIsmail Ben Ayed (Directeur(-trice)) & Pablo Piantanida (Codirecteur(-trice))

Mots-clés

  • apprentissage few-shot
  • classification
  • segmentation sémantique
  • transduction

Citer cette ressource

'