Passer à la navigation principale Passer à la recherche Passer au contenu principal

Constraint-based calibration for reliable deep learning models

Traduction de l'intitulé de la thèse: Calibrage de modèles en apprentissage profond
  • Balamurali Murugesan

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Malgré les progrès indéniables réalisés dans les tâches de reconnaissance visuelle grâce aux réseaux de neurones profonds, des données récentes montrent que ces modèles sont mal calibrés, ce qui entraîne des prédictions trop fiables. Les pratiques standard de minimisation de la perte d’entropie croisée pendant l’apprentissage favorisent la correspondance des probabilités softmax prédites avec les attributions d’étiquettes uniques. Néanmoins, cela produit une activation pré-softmax de la classe correcte nettement supérieure aux activations restantes, ce qui aggrave le problème de mauvais calibrage. Des observations récentes issues de la littérature sur la classification suggèrent que les fonctions de perte intégrant une maximisation implicite ou explicite de l’entropie des prédictions offrent des performances de calibrage de pointe. Malgré ces résultats, l’impact de ces pertes sur la tâche pertinente de calibrage des réseaux de segmentation d’images médicales, les nouvelles pertes spécifiques à la tâche de segmentation et le langage visuel reste inexploré. Dans le premier objectif, nous nous référons à l’un des travaux antérieurs de notre groupe, qui propose une perspective unifiée d’optimisation sous contraintes des pertes de calibrage de pointe actuelles. Plus précisément, ces pertes sont considérées comme des approximations d’une pénalité linéaire (ou d’un terme lagrangien) imposant des contraintes d’égalité sur les distances logit. Cela met en évidence une limitation importante de ces contraintes d’égalité strictes sous-jacentes, dont les gradients qui en résultent poussent constamment vers une solution non informative, ce qui pourrait empêcher d’atteindre le meilleur compromis entre performance discriminante et calibration du modèle lors de l’optimisation par gradient. Suite à nos observations, nous étendons à la segmentation d’images médicales la pénalité de généralisation simple et flexible proposée, qui impose une marge contrôlable sur les distances logit. Nous fournissons des expériences et des études d’ablation complètes sur cinq benchmarks de segmentation publics différents, axés sur diverses cibles et modalités, soulignant les capacités de généralisation de l’approche proposée. Nos résultats empiriques démontrent la supériorité de notre méthode par rapport aux pertes de calibration de pointe, tant en termes de calibration que de performance discriminante. Dans le deuxième objectif, nous proposons une perspective d’optimisation sous contrainte du lissage spatial des étiquettes variables (SVLS), démontrant qu’il peut être considéré comme une perte d’entropie croisée standard associée à une contrainte implicite imposant aux prédictions softmax de correspondre à une proportion de classe souple des pixels environnants. Notre formulation montre que le SVLS ne dispose pas d’un mécanisme permettant de contrôler explicitement l’importance de la contrainte, ce qui peut entraver le processus d’optimisation, car il devient difficile d’équilibrer efficacement la contrainte avec l’objectif principal. Suite à ces observations, nous proposons une solution simple et flexible basée sur des contraintes d’égalité sur les distributions logit. La contrainte proposée est appliquée par une pénalité linéaire simple, qui intègre un mécanisme explicite pour contrôler son poids. Notre approche offre non seulement une stratégie plus efficace pour modéliser les distributions logit, mais diminue également implicitement les valeurs logit, ce qui se traduit par des prédictions moins surconfiantes. Nous menons des expériences approfondies et des études d’ablation sur plusieurs benchmarks de segmentation d’images médicales, incluant diverses cibles et modalités, et démontrons la supériorité de notre méthode par rapport aux pertes d’étalonnage les plus récentes. De plus, plusieurs études d’ablation valident empiriquement les choix de conception de notre approche et démontrent son caractère agnostique vis-à-vis du modèle. Dans le troisième objectif, nous proposons une approche par contraintes par classe et par région pour résoudre le problème d’étalonnage erroné dans les modèles de segmentation sémantique. Plus précisément, nous formulons une solution qui prend en compte les spécificités de chaque catégorie et des différentes régions en introduisant des pondérations de pénalité indépendantes par classe et par région. Ceci contraste avec les travaux antérieurs, où une pondération de pénalité scalaire uniforme est utilisée, quelles que soient les catégories ou les régions. De plus, nous transposons le problème contraint à son homologue d’optimisation duale sans contrainte en utilisant une méthode lagrangienne augmentée (ALM). Cela évite d’ajuster manuellement chaque pondération de pénalité et permet, grâce à une série d’étapes itératives internes et externes, de trouver la valeur optimale de chaque pondération de pénalité, laquelle peut être apprise de manière adaptative. Des expériences approfondies sur deux benchmarks de segmentation populaires et deux structures de segmentation bien connues démontrent la supériorité de notre approche par rapport à un ensemble d’approches d’étalonnage récentes et pertinentes. Dans le quatrième objectif, nous démontrons empiriquement que les stratégies d’adaptation CLIP courantes, telles que les adaptateurs, l’apprentissage rapide et le réglage rapide au moment du test, dégradent considérablement les capacités de calibrage de la ligne de base zéro-shot en présence de dérive distributionnelle. Pour ces stratégies d’adaptation, nous démontrons que la cause sous-jacente du mauvais calibrage est en fait l’augmentation des plages logit. Cela contraste avec les travaux récents sur le calibrage des modèles entièrement supervisés, qui suggèrent que la cause inhérente du mauvais calibrage est plutôt l’augmentation de sa norme, due à la perte d’entropie croisée standard utilisée pour l’apprentissage. Sur la base de ces observations, nous présentons une solution simple et indépendante du modèle, qui consiste à mettre à l’échelle la plage logit de chaque échantillon en fonction des logits zéro-shot. Nous présentons également plusieurs alternatives pour adapter notre solution, qui peuvent être mises en oeuvre au moment de l’apprentissage ou de l’inférence. Des expériences approfondies sur des référentiels de classification OOD courants démontrent empiriquement l’efficacité de nos approches pour réduire l’erreur de calibrage, tout en conservant les performances discriminantes.
Date7 nov. 2025
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurJosé Dolz (Directeur(-trice)) & Ismail Ben Ayed (Codirecteur(-trice))

Mots-clés

  • calibrage de réseau
  • segmentation d’image
  • incertitude
  • modèles vision-langage
  • adaptation à quelques prises de vue
  • généralisation de domaine
  • adaptation au temps de test

Citer cette ressource

'