Passer à la navigation principale Passer à la recherche Passer au contenu principal

Symétrie U(1) et brisure de symétrie dans les couches d’activation de réseaux de neurones convolutifs profonds

  • Louis-François Bouchard

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie de la production automatisée

Résumé

Nous présentons un nouveau modèle reliant les réseaux de neurones convolutifs (CNNs) à la vision biologique et à la physique fondamentale des particules. La propagation de l’information dans un CNN est modélisée via une analogie avec un système optique, où l’information est concentrée près d’un goulot d’étranglement où la résolution spatiale 2D s’effondre autour d’un point focal 1 × 1 = 1. Un espace 3D (□, □, □) est défini par les coordonnées (□, □) dans le plan image et la couche CNN □, où un rayon principal (□, 0, 0) suis la direction de propagation de l’information à travers à la fois l’axe optique et le pixel central de l’image situé à (□, □) = (0, 0), autour duquel la mise au point spatiale la plus nette possible est limitée à un cercle de confusion dans le plan image. Notre idée est de modéliser le rayon optique principal (□, 0, 0) comme géométriquement équivalent au vecteur médian dans l’orthant positif □(□, □) □ □+ d’un espace d’activation des canaux a □ dimensions, par exemple le long du vecteur de niveaux de gris (ou de luminance) (□,□,□) dans l’espace colorimétrique RVB. L’information est ainsi concentrée dans un potentiel d’énergie □(□, □, □) = □(□, □, □) 2, qui, en particulier pour les couches de goulot d’étranglement □ des CNNs génériques, est fortement concentré et symétrique par rapport à l’origine spatiale (□, 0, 0) et présente le potentiel "Sombrero" de la particule de boson bien connu. Cette symétrie est brisée dans la classification où les couches de goulot d’étranglement des modèles CNN génériques préentraînés présentent un biais cohérent spécifique à la classe vers un angle □ □ □(1) défini simultanément dans le plan image et dans l’espace des caractéristiques d’activation. Les observations initiales valident notre hypothèse à partir de cartes d’activation extraites de CNNs génériques préentraînés et d’un schéma de classification basé sur la mémoire (K-NN), sans entraînements supplémentaires ni réglages optimisés. L’entraînement à partir de zéro à l’aide d’une fonction de perte combinant un composant symétrique et un composant antisymétrique, one-hot +□(1), améliore la classification pour toutes les tâches testées, y compris ImageNet, confirmant notre hypothèse de brisure de symétrie lors de la classification et agissant comme preuve de concept introduisant cette théorie. Nous soulignons également la ressemblance entre une image (réguliere, RVB) et une carte de caractéristique.
Date31 août 2022
langue originaleFrançais
Établissement diplômant
  • École de technologie supérieure
SuperviseurMatthew Toews (Directeur(-trice))

Mots-clés

  • vision par ordinateur
  • reconnaissance de formes
  • réseaux de neurones convolutifs

Citer cette ressource

'