Les techniques de sélection dynamique reposent sur l’idée que les classificateurs d’un ensemble sont experts dans différents domaines de l’espace des caractéristiques. En tant que telles, elles tentent d’identifier uniquement le(s) classificateur(s) le(s) plus compétent(s) pour étiqueter un échantillon de requête donné, généralement sur la base de l’hypothèse de localité, c’est-à-dire en supposant que des instances similaires partagent un ensemble similaire de classificateurs capables de les étiqueter correctement. Par conséquent, la réussite de la tâche de sélection dynamique est étroitement liée à la distribution locale des données, car elle établit la qualité de la région définie pour la tâche de sélection dynamique et peut affecter la manière dont l’expertise locale des classificateurs est perçue. Ainsi, des caractéristiques telles que le chevauchement des classes locales et la rareté des données peuvent conduire à une région locale mal définie présentant une hypothèse de localité faible, entravant ainsi la recherche d’un expert local.
Ainsi, dans cette thèse, plusieurs techniques qui intègrent le contexte local dans le système de classificateurs multiples sont proposées pour améliorer la sélection dynamique des classificateurs dans des scénarios difficiles. À cette fin, la définition d’une région locale adéquate est abordée en caractérisant les données locales et en définissant les régions à l’aide de différentes méthodes pour traiter les distributions complexes et avec des échelles multiples pour fournir un contexte ample au système. La présence d’experts locaux est également prise en compte en produisant le pool sur la frontière locale afin d’obtenir des classificateurs plus spécialisés, et en apprenant la tâche de sélection dynamique de bout en bout à partir des interactions des classificateurs et des relations entre les données locales afin de stimuler la recherche d’experts locaux. Ainsi, en exploitant les informations provenant de la distribution des données locales, la capacité des techniques de sélection dynamique à trouver des experts locaux peut être renforcée, ce qui améliore sa robustesse et ses performances sur des problèmes complexes.
Dans le chapitre 2, la technique du pool local en ligne (OLP) est proposée pour résoudre la difficulté que présentent les techniques de sélection dynamique dans la recherche d’experts locaux dans les zones de chevauchement. À cette fin, la technique OLP génère plusieurs modèles linéaires à proximité de l’instance interrogée avec différents degrés de localité pour produire des classificateurs capables de reconnaître la frontière locale. Pour identifier les zones de chevauchement des classes, une mesure de dureté de l’instance est calculée par mémorisation pour tous les échantillons disponibles, et les classificateurs sont conçus de manière à "couvrir" entièrement la région cible. Les résultats expérimentaux montrent que l’utilisation de la réserve locale générée a permis d’améliorer les techniques de sélection de classificateurs dynamiques évaluées par rapport à une réserve générée globalement, ce qui suggère l’avantage d’avoir des classificateurs localement spécialisés dans la réserve pour la tâche de sélection dynamique. L’approche proposée donne également des résultats similaires à ceux de plusieurs méthodes d’apprentissage de pointe.
Au chapitre 3, une méthode d’ensemble local basée sur l’OLP a été proposée, l’OLP++, pour remédier aux limitations que la première méthode présentait sur les données de haute dimension en raison de sa définition de la région locale sensible aux effets de la malédiction de la dimensionnalité. À cette fin, l’approche OLP++ exploite les partitions de données obtenues à partir d’algorithmes basés sur les arbres pour la définition de la localité, puis produit les experts locaux sur les différents nœuds impurs du chemin de décision qu’une instance de requête donnée traverse dans le(s) arbre(s), introduisant ainsi un contexte local de plus en plus large à l’ensemble local. Les résultats expérimentaux montrent que la définition de la région basée sur la partition récursive de l’OLP++ a permis d’identifier les instances limites plus souvent que la définition de la région basée sur les plus proches voisins de l’OLP, ce qui suggère une amélioration de la distribution des données utilisée pour apprendre les règles linéaires locales. La définition de région de l’OLP++ conduit également à un ensemble local plus diversifié et à une performance statistiquement supérieure à celle de l’OLP sur les données de haute dimension. L’OLP++ surpasse également la forêt aléatoire de référence et plusieurs techniques de sélection dynamique locale, ce qui confirme les avantages de l’approche proposée pour le traitement des données de haute dimension dans le contexte de la sélection dynamique.
Enfin, au chapitre 4, un nouveau système dynamique de classification multiple est proposé pour traiter les données éparses et superposées, car l’OLP++ présente une lacune en raison de sa dépendance à l’égard de partitions prédéfinies qui n’ont pas été optimisées pour la tâche de sélection dynamique. La technique proposée de sélection dynamique d’ensemble par réseau neuronal graphique (GNN-DES) résout ce problème en apprenant la tâche de sélection dynamique de bout en bout à l’aide d’un réseau neuronal graphique (GNN) multiétiquettes, qui est responsable de la sélection des experts locaux. En apprenant à partir des relations locales des échantillons, représentées dans un graphe, et des interdépendances des classificateurs, modélisées dans les méta-étiquettes, le GNN peut apprendre implicitement un espace intégré où l’hypothèse de localité est plus forte sans nécessiter une définition explicite de la région locale. Les résultats expérimentaux démontrent que les techniques classiques de sélection dynamique ont généralement du mal à traiter les données éparses et superposées, et que le GNN-DES est plus performant que la sélection statique de base et que plusieurs techniques basées sur les similarités dans l’espace des caractéristiques. Une analyse plus poussée montre également que le GNN-DES gère mieux les données éparses et les données qui se chevauchent. a obtenu de meilleurs résultats que les techniques concurrentes sur les problèmes où l’hypothèse de localité est plus faible en présence d’un chevauchement de classes, ce qui suggère que l’exploitation de la distribution locale des données et des interactions des classificateurs peut faciliter la tâche de sélection dynamique dans des scénarios difficiles.
| Date | 28 juil. 2023 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Robert Sabourin (Directeur(-trice)), George Darmiton da Cunha Cavalcanti (Codirecteur(-trice)) & Rafael Menelau Oliveira Cruz (Codirecteur(-trice)) |
|---|
- systèmes de classification multiples
- sélection dynamique
- apprentissage local
- chevauchement de classes
- dureté des instances
- rareté des données
- méta-apprentissage
- réseaux de neurones graphiques
De Araujo Souza, M. (Auteur(e)),
Sabourin (Directeur(-trice)), da Cunha Cavalcanti (Codirecteur(-trice)) &
Menelau Oliveira Cruz (Codirecteur(-trice)),
28 juil. 2023Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie