Notre étude concerne les réseaux de neurones convolutifs 3D(3D ConvolutionalNeuralNetworks, 3D-CNNs) pour la reconnaissance d’expressions faciales (Facial Expression Recognition, FER) dans les vidéos. Au cours des dernières années, l’apprentissage profond s’est imposé comme un principe majeur pour le développement de systèmes automatiques pour la FER. La transition de l’effort de recherche vers les systèmes d’apprentissage profond s’accompagne aussi d’une régression vers les méthodes spatiales, les modèles étant de plus en plus dépendants de la quantité de données d’entraînement, ce qui favorise les bases de données d’images 2D par rapport aux vidéos qui sont plus difficiles à collecter, annoter et analyser.
Dans ce mémoire, différentes approches pour la FER spatio-temporelle sont évaluées, utilisant des modèles d’apprentissage profond pré-entraînés. L’étude se concentre notamment sur le principe de convolutions 3D pour la classification de vidéos, questionnant la pertinence d’un traitement unifié des dimensions spatiales et temporelle, considérant les vidéos comme des volumes de données 3D. Pour limiter le coût de calculs et la consommation de mémoire, et pour gérer la relative rareté des données annotées, l’entraînement des réseaux 3D est généralement réalisé avec des clips vidéos très courts, extraits depuis les vidéos d’entraînement. Une nouvelle méthode est proposée pour l’amélioration des performances des modèles 3D. Le softmax stochastique temporel ainsi développé est basé sur une pondération temporelle du mécanisme de sélection des clips d’entraînement. Cette méthode permet au modèle de se concentrer sur les clips les plus pertinents, résultant dans l’amélioration de l’efficacité de l’entraînement et des performances de classification. Des expériences sont réalisées sur différentes tâches de classification vidéo, principalement en FER, montrant la pertinence d’une telle pondération des mécanismes d’échantillonnage et d’agrégation temporels pour répondre aux problèmes habituels tels que l’occlusion, le découpage imprécis et l’annotation grossière des vidéos, et la distribution inégale de l’information pertinente dans les vidéos au cours du temps. De plus, l’étude se porte sur les mécanismes d’attention visuelle, pour opérer des pondérations plus complexes inhibant ou renforçant certaines régions de vidéo. Les différents types d’attention qui peuvent être développés pour les 3D-CNNs sont analysés, clarifiant leur pertinence pour la reconnaissance spatio-temporelle et la FER en particulier. Les expériences montrent notamment l’intérêt d’une représentation contextuelle, intégrant le contenu global de la vidéo, pour guider l’attention sur certaines positions. À travers ces thèmes, l’étude porte sur l’importance relative des frames temporelles dans une vidéo, pour répondre à la distribution inégale de l’information pertinente dans le temps.
| Date | 10 juin 2021 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Éric Granger (Directeur(-trice)), Marco Pedersoli (Codirecteur(-trice)) & Simon Bacon (Codirecteur(-trice)) |
|---|
- informatique affective
- reconnaissance d’expressions faciales
- reconnaissance spatio-temporelle
- apprentissage profond
- 3D CNNs
- attention visuelle
Ayral, T. (Auteur(e)),
Granger (Directeur(-trice)),
Pedersoli (Codirecteur(-trice)) & Bacon (Codirecteur(-trice)),
10 juin 2021Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie de la production automatisée