Passer à la navigation principale Passer à la recherche Passer au contenu principal

Learning visual recognition models with limited data

Traduction de l'intitulé de la thèse: Apprentissage de modèles de reconnaissance visuelle dans un contexte de données et de ressources de calcul limitées
  • Saypraseuth Mounsaveng

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

L’apprentissage profond, en particulier à travers l’usage des réseaux neuronaux profonds, a connu un franc succès dans le domaine de la vision par ordinateur. Les modèles à grande échelle, constitués de millions de paramètres, ont révolutionné le domaine en capturant des schémas complexes pour offrir des performances compétitives dans des tâches telles que la classification d’images, la détection d’objets ou la segmentation sémantique. L’entraînement avec des bases de données de grande taille est essentiel pour améliorer la généralisation des modèles, et permet des prédictions précises sur de nouvelles données. Malgré les performances exceptionnelles de ces modèles, des défis subsistent en raison des difficultés pouvant survenir lors de l’acquisition des données et du potentiel décalage entre les distributions des données d’entraînement et de test.Cette thèse vise à relever ces défis en explorant différentes façons d’optimiser l’apprentissage et l’adaptation des réseaux neuronaux profonds.Dans un premier chapitre, nous explorons l’utilisation de modèles génératifs pour créer de nouvelles images utiles pour une tâche sousjacente. Plus particulièrement, nous exploitons la capacité des réseaux antagonistes génératifs (GAN) à générer de nouveaux échantillons augmentés permettant d’améliorer la robustesse et les performances d’un classificateur d’images. Contrairement aux transformations traditionnelles choisies de façon heuristique, l’approche présentée apprend l’augmentation de données optimale directement à partir des données d’entraînement en utilisant une architecture encodeur-décodeur et un réseau transformateur spatial, produisant des échantillons plus complexes au sein de la même classe.Dans un second chapitre, nous proposons une approche visant à réduire les calculs nécessaires pour déterminer la meilleure augmentation de données possible. Nous optimisons les paramètres d’augmentation à l’aide d’un ensemble de validation par une optimisation bi-niveaux, améliorant ainsi la généralisation du modèle sans avoir besoin d’une boucle de validation externe coûteuse. La méthode a été validée aussi bien sur des images naturelles que sur des images histologiques.Enfin, dans un troisième chapitre, nous explorons l’adaptation pendant l’inférence (TTA) et présentons une sélection et catégorisation de techniques TTA intéressantes pour adapter les modèles aux dérives de données. Ces techniques sont la normalisation par petits lots, le rebalancement des classes du flux, la sélection d’échantillons fiables et l’étalonnage de la confiance du réseau. Nous donnons un aperçu de leur impact dans différents scénarios et mettons en évidence des compromis nécessaires entre précision, puissance de calcul et complexité du modèle. Nous présentons également les synergies qui résultent de la combinaison de ces techniques.Les travaux présentés ouvrent de nouvelles voies pour des recherches futures et offrent des aperçus et des solutions pratiques pour l’entraînement et l’adaptation des réseaux neuronaux profonds dans un contexte de données limitées.
Date13 oct. 2023
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurMarco Pedersoli (Directeur(-trice)) & Ismail Ben Ayed (Codirecteur(-trice))

Mots-clés

  • classification d’images
  • augmentation de données
  • réseaux antagonistes génératifs
  • optimisation bi-niveaux
  • adaptation au moment du test

Citer cette ressource

'