L’apprentissage profond a révolutionné la perception tridimensionnelle, permettant la reconnaissance, la segmentation et la reconstruction précises des nuages de points dans des domaines tels que la robotique, la navigation autonome et la réalité augmentée. Cependant, deux défis majeurs persistent. Premièrement, les modèles 3D à grande échelle dépendent fortement de jeux de données annotés, dont la création est coûteuse et chronophage. Cela motive le développement de méthodes d’apprentissage auto-supervisé capables de préentraîner des modèles sur des données non annotées et d’apprendre des représentations géométriques transférables pour des tâches en aval disposant de peu d’annotations. Deuxièmement, les modèles entraînés dans des conditions fixes échouent souvent à se généraliser lorsqu’ils sont exposés à des décalages de distribution réels causés par le bruit, les variations des capteurs ou les changements d’environnement. Ce problème motive la conception de cadres d’apprentissage à la fois robustes face aux décalages de distribution et adaptatifs à de nouveaux environnements, sans nécessiter de données annotées.
Cette thèse fait progresser la robustesse et la généralisabilité de l’apprentissage profond 3D à travers une exploration unifiée de l’apprentissage de représentations auto-supervisé et de l’apprentissage en phase de test (TTL). La première partie étudie comment construire des priors géométriques permettant aux modèles d’apprendre des représentations 3D significatives et transférables. (1) GeoMask3D introduit une stratégie de modélisation masquée sensible à la géométrie, alignant explicitement le préentraînement masqué sur les indices structurels des formes 3D, améliorant ainsi l’interprétabilité et l’invariance des caractéristiques apprises. (2) Spectral-Informed Mamba étend les modèles d’espace d’état aux nuages de points en exploitant le spectre laplacien des graphes de variétés, définissant un ordre de parcours invariant à l’isométrie qui améliore la robustesse aux changements de point de vue et la précision de la segmentation, tout en atteignant une complexité computationnelle linéaire par rapport aux conceptions quadratiques des Transformers.
La seconde partie traite de l’adaptation à des conditions de test inédites, en proposant des méthodes efficaces et fiables d’entraînement en phase de test (TTT) et d’adaptation en phase de test (TTA). (3) Sampling-Variation Weight Averaging (SVWA) présente la première stratégie TTAcomplète pour les nuages de points, combinant la variation d’échantillonnage et la moyenne des poids afin d’obtenir une adaptation robuste grâce à une optimisation autour de minima plats. (4) SMART-PC introduit un cadre TTT basé sur le squelette qui apprend des abstractions géométriques compactes durant le préentraînement, permettant une adaptation en temps réel sans rétropropagation en mettant à jour uniquement les statistiques de BatchNorm.
Ensemble, ces contributions établissent un cadre cohérent pour un apprentissage profond géométrique 3D à la fois robuste et généralisable. En unifiant le préentraînement auto-supervisé et l’apprentissage efficace en phase de test, cette thèse fait progresser les systèmes de perception 3D vers des performances stables, adaptatives et résilientes face aux décalages de distribution réels, tout en préservant l’interprétabilité et l’efficacité computationnelle.
| Date | 14 mars 2026 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Christian Desrosiers (Directeur(-trice)) & Ismail Ben Ayed (Codirecteur(-trice)) |
|---|
- apprentissage auto-supervisé
- apprentissage de représentations 3D
- adaptation en phase de test
- entraînement en phase de test
Bahri, A. (Auteur(e)),
Desrosiers (Directeur(-trice)) &
Ben Ayed (Codirecteur(-trice)),
14 mars 2026Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie