Les êtres humains utilisent principalement deux méthodes de communication pour réussir leurs interactions sociales Cowie et al. (2001). La première, la plus évidente, la parole permet de transmettre explicitement les messages pour une grande variété de situations, l’autre, l’emotion humaine, est plus subtile et transmet des messages implicites sur les personnes eux-mêmes. Au cours des dernières années, avec l’avancement de la technologie, l’interprétation du premier canal est devenue de plus en plus facile. Par exemple, les systèmes de traitement de la parole peuvent facilement convertir la parole en texte ou les systèmes de vision par ordinateur peuvent détecter un visage dans une image. Le deuxième canal de communication n’est pas encore aussi bien maîtrisé. L’un des éléments clés de l’exploitation de la communication implicite est l’interprétation de l’émotion humaine, qui une tâche assez difficile, même pour les humains. Pour résoudre ce problème, les travaux antérieurs sur la reconnaissance des émotions se sont appuyés sur des caractéristiques faites à la main en incorporant la connaissance du domaine dans le système sous-jacent. Cependant, au cours des dernières années, les réseaux neuronaux profonds se sont avérés être des modèles efficaces pour s’attaquer à une variété de tâches.
Dans cette thèse, nous explorons les effets de l’application de méthodes d’apprentissages profonds à la tâche de la reconnaissance des émotions. Nous démontrons ces méthodes en montrant que les représentations obtenus sont plus riches et atteignent une précision supérieure à celle des techniques traditionnelles. De plus, nous démontrons que nos méthodes ne sont pas liées aux tâches de reconnaissance des émotions et que d’autres catégories de tâches telles que la classification multi-étiquettes peuvent aussi bénéficier de nos approches.
La première partie de ce travail se concentre uniquement sur la tâche de la reconnaissance des émotions par la vidéo en utilisant uniquement des entrées visuelles. Nous montrons qu’en exploitant l’information des aspects spatiaux et temporels des données d’entrée, nous pouvons obtenir des résultats prometteurs. Dans la deuxième partie, nous portons notre attention sur les données multimodales. Nous nous concentrons en particulier sur la manière de fusionner les données multimodales. Nous introduisons ensuite une nouvelle architecture qui incorpore les meilleures caractéristiques des architectures de fusion précoce et tardive.
| Date | 20 juil. 2020 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Patrick Cardinal (Directeur(-trice)) & Marco Pedersoli (Codirecteur(-trice)) |
|---|
- informatique affective
- reconnaissance des émotions
- mécanismes d’attention
- réseaux neuronaux convolutionnels
- fusion multimodale
Aminbeidokhti, M. (Auteur(e)),
Cardinal (Directeur(-trice)) &
Pedersoli (Codirecteur(-trice)),
20 juil. 2020Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie des technologies de l'information