Passer à la navigation principale Passer à la recherche Passer au contenu principal

Deep audio and video emotion detection

Traduction de l'intitulé de la thèse: Détection d’émotions audio et vidéo profondes
  • Masih Aminbeidokhti

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie des technologies de l'information

Résumé

Les êtres humains utilisent principalement deux méthodes de communication pour réussir leurs interactions sociales Cowie et al. (2001). La première, la plus évidente, la parole permet de transmettre explicitement les messages pour une grande variété de situations, l’autre, l’emotion humaine, est plus subtile et transmet des messages implicites sur les personnes eux-mêmes. Au cours des dernières années, avec l’avancement de la technologie, l’interprétation du premier canal est devenue de plus en plus facile. Par exemple, les systèmes de traitement de la parole peuvent facilement convertir la parole en texte ou les systèmes de vision par ordinateur peuvent détecter un visage dans une image. Le deuxième canal de communication n’est pas encore aussi bien maîtrisé. L’un des éléments clés de l’exploitation de la communication implicite est l’interprétation de l’émotion humaine, qui une tâche assez difficile, même pour les humains. Pour résoudre ce problème, les travaux antérieurs sur la reconnaissance des émotions se sont appuyés sur des caractéristiques faites à la main en incorporant la connaissance du domaine dans le système sous-jacent. Cependant, au cours des dernières années, les réseaux neuronaux profonds se sont avérés être des modèles efficaces pour s’attaquer à une variété de tâches. Dans cette thèse, nous explorons les effets de l’application de méthodes d’apprentissages profonds à la tâche de la reconnaissance des émotions. Nous démontrons ces méthodes en montrant que les représentations obtenus sont plus riches et atteignent une précision supérieure à celle des techniques traditionnelles. De plus, nous démontrons que nos méthodes ne sont pas liées aux tâches de reconnaissance des émotions et que d’autres catégories de tâches telles que la classification multi-étiquettes peuvent aussi bénéficier de nos approches. La première partie de ce travail se concentre uniquement sur la tâche de la reconnaissance des émotions par la vidéo en utilisant uniquement des entrées visuelles. Nous montrons qu’en exploitant l’information des aspects spatiaux et temporels des données d’entrée, nous pouvons obtenir des résultats prometteurs. Dans la deuxième partie, nous portons notre attention sur les données multimodales. Nous nous concentrons en particulier sur la manière de fusionner les données multimodales. Nous introduisons ensuite une nouvelle architecture qui incorpore les meilleures caractéristiques des architectures de fusion précoce et tardive.
Date20 juil. 2020
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurPatrick Cardinal (Directeur(-trice)) & Marco Pedersoli (Codirecteur(-trice))

Mots-clés

  • informatique affective
  • reconnaissance des émotions
  • mécanismes d’attention
  • réseaux neuronaux convolutionnels
  • fusion multimodale

Citer cette ressource

'