La reconnaissance visuelle, qui englobe des tâches telles que la classification, la localisation et la segmentation d’objets, est cruciale pour différentes applications de vision par ordinateur allant de la conduite autonome à l’analyse d’images médicales. Les récentes avancées dans le domaine des réseaux neuronaux profonds ont permis d’améliorer considérablement ces tâches. Cependant, le succès de ces modèles est fortement attribué à la grande quantité de données annotées, dont l’acquisition est coûteuse et prend du temps. En outre, ce paradigme n’est pas extensible à différents domaines, car il n’est pas pratique de collecter des millions d’images étiquetées pour chaque domaine dans lequel nous voulons déployer notre modèle d’apprentissage profond. Pour éviter de dépendre d’annotations étendues, la communauté des chercheurs a exploré différents paradigmes d’apprentissage, y compris les méthodes d’apprentissage semi-supervisé, auto-supervisé et faiblement supervisé. Pour contribuer à cet effort, cette thèse se concentre sur l’apprentissage faiblement supervisé pour la localisation d’objets. Tout d’abord, nous avons identifié les défis associés aux méthodes existantes, suivis par la proposition de nouvelles directions visant à améliorer la performance de la localisation d’objets.
DiPS est la première contribution à cette thèse ; nous proposons d’exploiter les cartes agnostiques en termes de classes des transformateurs auto-supervisés pour la localisation d’objets faiblement supervisée, où seules les étiquettes de classes d’images sont disponibles. En utilisant différentes cartes d’attention provenant de transformateurs auto-supervisés, nous sélectionnons d’abord une carte qui contient des régions discriminantes correspondant à l’objet d’intérêt pour générer des propositions d’objets. Ces propositions sont ensuite utilisées pour construire des pseudoétiquettes en sélectionnant quelques pixels d’arrière-plan et de premier plan qui correspondent au modèle, lequel est capable d’effectuer à la fois des tâches de classification et de localisation. Cet échantillonnage permet à notre modèle d’atténuer les suractivations et le bruit de fond. Des expériences approfondies sur les ensembles de données difficiles TelDrone, CUB, OpenImages et ILSVRC montrent que la méthode proposée permet d’obtenir de meilleures performances de localisation que les méthodes de pointe.
En deuxième lieu, nous introduisons la distillation de texte pour la localisation (TeD-Loc), une stratégie d’apprentissage pour distiller des informations de localisation à partir d’enchâssements de texte CLIP dans la colonne vertébrale visuelle de notre modèle afin d’améliorer les performances de localisation. Les méthodes WSOL conventionnelles extraient généralement des cartes de localisation à partir de classificateurs pré-entraînés, qui ont tendance à se concentrer sur les parties d’objet les plus discriminantes et ne parviennent pas à mettre en évidence les différents objets. Les méthodes WSOL récentes qui s’appuient sur des modèles vision-langage tels que CLIP dépendent également des étiquettes de classe de vérité au sol ou des prédictions de classe des classificateurs externes pour générer des cartes de localisation, ce qui limite leur déploiement dans différentes applications. Pour remédier à ces limitations, TeD-Loc distille des informations à partir de l’intégration de textes CLIP dans l’épine dorsale de notre modèle de vision. En outre, en formulant le problème dans un cadre d’apprentissage multi-instances, TeD-Loc permet au modèle de converger pour les tâches de localisation et de classification d’objets. Les résultats expérimentaux montrent que TeD-Loc atteint des performances de pointe.
La troisième contribution de cette thèse est un protocole d’évaluation réaliste pour WSOL. Comme les modèles WSOL sont formés à partir d’étiquettes au niveau de la classe, leur évaluation, l’ajustement des hyperparamètres et la sélection reposent toujours sur un ensemble de validation qui comprend des annotations de boîtes de délimitation. L’utilisation d’annotations de boîtes de délimitation pour l’évaluation n’est pas conforme au paradigme WSOL, ce qui conduit à une surestimation des performances de localisation. Pour une évaluation réaliste, nous proposons d’utiliser des pseudo-boîtes pour un ensemble de validation qui peut être obtenu à partir de la méthode de proposition de région prête à l’emploi. Des expériences approfondies sur des ensembles de données d’images naturelles et médicales montrent que les performances du modèle évalué à l’aide de pseudo-boîtes sont comparables à celles obtenues à l’aide de boîtes GT annotées manuellement.
| Date | 10 juin 2025 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Éric Granger (Directeur(-trice)) & Marco Pedersoli (Codirecteur(-trice)) |
|---|
- localisation d’objets
- localisation d’objets faiblement supervisée
- transformateurs de vision
- apprentissage auto-supervisé
- apprentissage profond
Murtaza, S. (Auteur(e)),
Granger (Directeur(-trice)) &
Pedersoli (Codirecteur(-trice)),
10 juin 2025Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie