La reconnaissance des expressions (RE) est un problème difficile dans le domaine de l’informatique affective, qui joue un rôle important dans la compréhension automatique des expressions et des émotions humaines. La reconnaissance des expressions peut être formulée autant comme un problème de classification que de régression. Bien que l’identification automatique des expressions exprimée comme un problème de régression joue un rôle crucial dans de nombreuses applications de santé, telles que l’estimation des niveaux de douleur et de fatigue, elle reste relativement peu explorée par rapport à la classification des expressions. La détection du niveau de fatigue est largement utilisée dans un certain nombre d’applications telles que la conduite autonome, les soins de santé et l’engagement des employés. Dans le même ordre d’idée, l’évaluation automatique du niveau de douleur a une valeur diagnostique potentielle importante pour les personnes telles que les nourrissons, les jeunes enfants et les personnes souffrant de troubles de la communication ou de troubles neurologiques. On a constaté que la fatigue est synchrone avec la douleur, une fatigue élevée étant associée à une douleur élevée, ce qui peut être constaté par la corrélation des scores analogiques visuels (VAS) de la fatigue et de la douleur. Cependant, l’expression de la douleur se produit sur une période plus courte, alors que la fatigue se manifeste sur une période plus longue.
Dans cette thèse, nous nous sommes principalement concentrés sur le développement de modèles profonds (DL) pour la reconnaissance des expressions basée sur la régression en tirant parti des relations spatio-temporelles ainsi que des modalités audio et visuelles disponibles dans les enregistrements vidéos. Les problèmes de régressions posent certains défis, tels que la capture de subtiles variations relatives à l’intensité des expressions entre deux images contiguës, les variations entre les individus et les conditions de capture, l’entraînement des modèles DL avec des vidéos faiblement étiquetées, la fusion efficace des modalités audio et visuelles, etc. Afin de d’amoindrir les effets de ces défis, nous nous concentrons sur le développement de modèles DL pour deux problèmes : (1) l’adaptation au domaine dans un contexte d’entrainement faiblement supervisée (WSDA) dans un problème d’estimation de l’intensité de la douleur, et (2) la fusion audio-visuelle (A-V) pour la reconnaissance dimensionnelle des émotions appliquée à la reconnaissance dimensionnelle des émotions.
Dans un premier temps, nous avons présenté une revue détaillée des approches d’apprentissage faiblement supervisé (WSL) dans le contexte de l’analyse du comportement facial. Afin de fournir une revue complète du domaine, nous avons également inclus l’utilisation des unités d’action (UA) en plus des expressions pour la classification et l’analyse du comportement facial. Nous avons également ajouté des unités d’action (UA) aux expressions pour les problèmes de régression. En particulier, nous avons fourni une taxonomie des méthodes existantes basées sur des scénarios WSL ainsi que leurs forces et limites respectives. Un examen des ensembles de données largement utilisés, des protocoles expérimentaux et des résultats expérimentaux sont également présentés et discutés. Enfin, notre analyse critique de ces méthodes permet de mieux comprendre les directions de recherche potentielles pour exploiter les données faiblement étiquetées dans le cadre de l’analyse du comportement facial. Cette revue conclut que les méthodes WSL sont prometteuses pour gérer les données faiblement étiquettés dans les bases de données contenant des expressions faciales obtenus à partir de scénarios réels mais qu’elles ne sont pas suffisament explorées dans la littérature. Il y a par conséquent beaucoup de place pour améliorer la performance de l’ER faciale à partir de données faiblement annotées.
La deuxième contribution propose un nouveau modèle de DL pour l’adaptation de domaine, avec régression ordinale (WSDA-OR) afin d’estimer l’intensité de la douleur et de la fatigue dans des enregistrements vidéos, le tout dans un problème de régression. L’adaptation au domaine a été largement exploré afin d’atténuer les problèmes dus aux changements de domaines, principalement causés par des conditions de captures différentes entre les données utilisées pour l’entrainement (en laboratoire) et en production. Dans ce travail, l’adaptation au domaine est exploitée pour adapter un modèle DL à différentes personnes et conditions d’enregistrement dans le contexte où les vidéos sont faiblement annotées. Contrairement aux modèles WSL de pointe utilisés pour l’estimation de l’intensité de la douleur dans les vidéos, le modèle proposé renforce la relation ordinale entre les niveaux d’intensité de la douleur des séquences cibles en même temps que la cohérence temporelle sur plusieurs images consécutives. En particulier, il apprend des représentations de caractéristiques qui sont à la fois discriminantes et invariantes par rapport au domaine en intégrant l’apprentissage d’instances multiples avec l’apprentissage contradictoire, où des étiquettes gaussiennes sont utilisées pour représenter efficacement les étiquettes ordinales faibles au niveau des séquences du domaine cible. Les résultats expérimentaux sur les ensembles de données UNBC-McMaster, BIOVID et Fatigue (private) indiquent que l’approche proposée peut améliorer significativement les performances lorsque comparée aux modèles de pointe, ce qui permet d’atteindre une plus grande précision dans la localisation de la douleur.
En troisième lieu, un modèle d’attention croisée est proposé pour la fusion A-V pour la reconnaissance dimensionnelle des émotions basée sur les modalités faciales et vocales. La plupart des méthodes de pointe pour la fusion A-V reposent sur des réseaux récurrents ou des mécanismes d’attention conventionnels qui n’exploitent pas efficacement la nature complémentaire des modalités A-V. Dans ce travail, la relation complémentaire entre les modalités A-V est explorée afin d’extraire les caractéristiques saillantes, ce qui permet une prédiction précise des valeurs continues de valence et d’excitation. Les résultats expérimentaux sur RECOLA et Affwild2 indiquent que notre modèle de fusion A-V inter-attentionnel fournit une solution rentable qui peut surpasser les approches les plus récentes.
Les travaux décrits dans cette thèse indiquent clairement que l’adaptation efficace des modèles DL avec des vidéos faiblement étiquetées montre une amélioration significative par rapport aux méthodes de pointe précédentes dans le contexte de l’estimation des niveaux de douleur et de fatigue. En outre, ce travail a montré que l’exploitation de la relation complémentaire entre les modalités A-V joue un rôle crucial dans la fusion efficace des modalités dans le domaine de la reconnaissance dimensionnelle des émotions. Ce travail montre en outre qu’exploiter la complémentarité entre les modalités A et V est un axe de recherche prometteur. L’approche interattentionnelle conjointe proposée pourrait également être améliorée en utilisant des mécanisme de porte ("gating") pour efficacement modéliser les relations intra et intermodales. De plus, l’approche proposée est plus résiliente lorsqu’une modalité n’est pas disponible.
| Date | 2 juin 2023 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Éric Granger (Directeur(-trice)) & Patrick Cardinal (Codirecteur(-trice)) |
|---|
- apprentissage en profondeur
- apprentissage à instances multiples
- adaptation domaine
- évaluation de la douleur
- fusion audiovisuelle
- reconnaissance dimensionnelle des émotions
- modèles d’attention
Rajasekhar, G. P. (Auteur(e)),
Granger (Directeur(-trice)) &
Cardinal (Codirecteur(-trice)),
2 juin 2023Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie