Passer à la navigation principale Passer à la recherche Passer au contenu principal

Doublage visuel des vidéos monoculaires

  • Houssem Zouaghi

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie des technologies de l'information

Résumé

Le doublage audio est une technique de reproduction des dialogues des acteurs dans une langue différente de la langue originale. Malgré le succès de cette technique, elle nécessite un travail immense pour trouver les meilleurs mots et phrases qui synchronisent les phonèmes doubles avec les visèmes de l’acteur. Pour remédier à cette limite, plusieurs chercheurs ont travaillé sur le doublage visuel des vidéos. Cette méthode consiste à la modification des visages des acteurs afin de synchroniser les expressions avec la voix doublée. Cependant, les méthodes existantes ont des exigences qui limitent leur utilisation dans notre contexte. Par exemple, la nécessité de la présence de l’acteur pour la numérisation de son visage, la disponibilité de longues vidéos avec différentes expressions ou l’utilisation d’équipements complexes et coûteux. Dans ce mémoire, l’objectif principal consiste à réaliser un doublage visuel de courtes vidéos publicitaires. Pour ce faire, nous proposons deux méthodes de doublage visuel des vidéos monoculaires. La première approche est principalement basée sur des visages 3D. Dans cette approche, nous reconstruisons les visages 3D de l’acteur et du doubleur. Ensuite, à l’aide d’un modèle de visage bilinéaire, nous extrayons les poids d’identité de la séquence reconstruite de l’acteur et les poids des expressions de la séquence reconstruite du doubleur. Puis, en utilisant de ces deux poids, nous recréons l’animation 3D du visage de l’acteur double. La seconde approche est basée sur l’apprentissage machine avec des images 2D. Nous utilisons un modèle d’apprentissage automatique pour extraire l’identité du visage de l’acteur et la transférer ensuite sur le visage du doubleur. Ensuite, nous fusionnons le résultat du doublage avec les images de la séquence originale. Les deux approches ont été testées sur une variété d’acteurs et de doubleurs récitant différentes paroles. Les résultats des deux approches sont encourageants et démontrent des progrès pour le doublage visuel automatique avec le minimum d’équipement sur les vidéos monoculaires RVB pré-enregistrées.
Date16 avr. 2021
langue originaleFrançais
Établissement diplômant
  • École de technologie supérieure
SuperviseurEric Paquette (Directeur(-trice))

Mots-clés

  • infographie
  • doublage visuel
  • animation 3D
  • reconstruction faciale
  • modèle bilinéaire

Citer cette ressource

'