Cette thèse évalue l’utilisation de réseaux neuronaux convolutifs (CNN) pré-entraînés comme extracteurs de caractéristiques génériques pour de nouveaux contextes de classification d’images, une stratégie connue sous le nom d’apprentissage par transfert. Un certain nombre de questions de recherche ouvertes sont abordées, étant donné la disponibilité croissante de diverses architectures de CNN pré-entraînés de haute performance pour l’apprentissage par transfert : Quels sont les réseaux et les couches d’activation de réseau les plus efficaces pour l’apprentissage par transfert ? Est-il possible de combiner différents réseaux pour améliorer la classification ? Comment l’efficacité de la classification diffère-t-elle selon les contextes de données, c’est-à-dire selon les grandes catégories visuelles (par exemple, bâtiments, voitures) et les contextes d’imagerie spécifiques (par exemple, photos du visage ou du cerveau de la même personne ou des membres de la même famille) ?
Un modèle de classification générique basé sur la mémoire est proposé afin d’évaluer et de comparer la précision des architectures CNN, où des cartes d’activation génériques provenant de réseaux arbitraires servent de caractéristiques d’image et où la classification est réalisée par l’indexation du plus proche voisin.
Un certain nombre de modèles de mise en commun et de normalisation des caractéristiques sont évalués, notamment la mise en commun (pooling) maximale, moyenne et moyenne généralisée, et les modèles de normalisation comprennent des cartes d’activation brutes et la normalisation L2. Enfin, un schéma de codage binaire des caractéristiques est proposé pour comprimer les données et améliorer la précision de la classification, où les caractéristiques d’activation individuelles sont binarisées afin de maximiser le gain d’informations. Comme base de référence supplémentaire, la classification est également évaluée à l’aide de caractéristiques d’images traditionnelles extraites via la transformation de caractéristiques invariantes à l’échelle (SIFT).
L’évaluation compare une liste importante et complète d’architectures CNN existantes, toutes pré-entrainées sur l’ensemble de données standard ImageNet (1000 catégories x 1000 images), y compris VGG, Inception, ResNet, Xception, DenseNet, MobileNet,NasLarge, NasMobile etc. Afin d’éviter tout biais potentiel vers les données utilisées dans la préformation des CNN, les expériences de classification sont basées sur des ensembles de données d’images indépendants et des catégories sans rapport avec les données ImageNet. Celles-ci comprennent de larges catégories visuelles issues de l’ensemble de données Caltech101 (Fei-Fei et al. (2004)), et des contextes spécifiques comprenant des images de visages humains issues de l’ensemble de données FERET (Phillips et al. (1998)) et des images de résonance magnétique du cerveau humain issues du projet Human Connectome (HCP) (Van Essen et al. (2013)).
Pour les catégories générales (données Caltech101), les précisions les plus élevées pour chaque réseau vont de 73,29% à 93,02% pour les réseaux (NasMobile couche 739) et (DenseNet201 couche 704), respectivement, ce qui est cohérent aux résultats de l’état de l’art. La concaténation de couches de haute précision provenant de différents réseaux augmente généralement la précision, la précision la plus élevée (94,01%) a été obtenue en combinant (Xception, Resnet, DenseNet, et InceptionResNetV2).
Pour les cas de visages spécifiques (données FERET), la plus grande précision de reconnaissance (parfaite à 100 %) est obtenue à partir des réponses des filtres dans les couches du réseau et pour la correspondance SIFT 2D. Les réponses des filtres à la sortie du réseau sont moins précises (98%).
La binarisation améliore la précision de la classification par sexe (InceptionV3 avec binarisation, AUC=0,981) par rapport à (InceptionV3 sans binarisation, AUC=0,966), ce qui est supérieur à la SIFT 2D (AUC=0,926). Pour les cas de cerveau humain (données HCP), les fonctions CNN préformées combinées aux fonctions SIFT 3D permettent d’obtenir une précision de pointe pour la classification binaire des sexes (DenseNet201 avec binarisation, AUC=0,987), et la classification des membres de famille pour 1010 sujets et 400 familles est (DenseNet201 avec binarisation, AUC=0,925).
| Date | 2 oct. 2020 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Matthew Toews (Directeur(-trice)) |
|---|