Passer à la navigation principale Passer à la recherche Passer au contenu principal

Unsupervised speech representation learning

Traduction de l'intitulé de la thèse: Apprentissage non supervisé de représentations distribuées pour la parole
  • Gilles Boulianne

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Les représentations distribuées visent à extraire l’information de haut niveau contenue dans des données brutes, habituellement sous forme de vecteurs de faible dimension. Lorsqu’utilisées comme entrée pour des tâches de classification, elles réduisent la complexité du classificateur, et facilitent l’apprentissage par transfert et l’adaptation au domaine. La représentation est dite interprétable lorsqu’elle saisit des facteurs sous-jacents compréhensibles; elle est alors utile pour explorer et comprendre les données, ou résoudre des problèmes mettant en jeu ces facteurs. En traitement automatique du langage naturel (TALN), des représentations telles que les plongements de mots ou de phrases ("embeddings") sont récemment devenues incontournables. Ces représentations peuvent être apprises sans supervision, sur de grands ensembles de données non annotées, rendant possible l’entraînement de modèles puissants capables de saisir les relations sémantiques requises pour plusieurs problèmes de TALN. En traitement de la parole, des représentations telles que les paramètres à goulot d’étranglement ("bottleneck features") et x-vecteurs ont été proposées, mais leur apprentissage doit être entièrement ou partiellement supervisé avec des annotations, et elles ne visent pas à extraire des facteurs sous-jacents interprétables. Une représentation non supervisée de la parole, qui serait apprise directement sur un grand corpus enregistré, sans transcription, aurait un impact majeur sur plusieurs applications du traitement de la parole. La transcription est une tâche manuelle coûteuse et se révèle souvent une contrainte importante, particulièrement dans le cas des langues à faibles ressources. Une représentation découplant la variabilité due au locuteur de celle due au contenu phonétique permettrait d’éliminer une des sources principales de confusion, que ce soit pour la transcription automatique ou bien la reconnaissance du locuteur. Malgré ce potentiel intéressant, l’apprentissage non supervisé d’une représentation pour la parole a été moins étudié que l’apprentissage supervisé. Dans cette thèse, nous présentons un modèle génératif capable d’apprendre une représentation interprétable sans supervision. Plus précisément, nous proposons plusieurs extensions au modèle d’autoencodeur variationnel (VAE), une approche probabiliste qui conjugue l’approche générative et les réseaux neuronaux profonds. Pour inciter le modèle à capturer des facteurs sous-jacents interprétables et découplés, nous lui imposons des biais inductifs inspirés des théories acoustiques et articulatoires de la production de la parole. Nous proposons d’abord le filtrage temporel comme biais induisant une représentation avec une échelle temporelle différente pour chacune des variables latentes. Il permet de répartir les variables latentes sur une échelle continue, au lieu de l’opposition binaire ou de la structure hiérarchique qui ont été proposées antérieurement. Nous montrons également comment imposer des distributions a priori multimodales afin de capturer des variables latentes discrètes, et nous présentons pour le VAE deux nouvelles fonctions de pertes applicables aux variables discrètes, utilisant la réestimation espérance maximisation avec divergence pairée et l’échantillonnage de la divergence. De plus, nous proposons l’auto-attention pour ajouter au modèle VAE la capacité de prédire des suites, à notre connaissance la première application de l’auto-attention pour de l’apprentissage non supervisé en parole. Avec des données simulées, nous confirmons que le modèle proposé peut retrouver exactement les facteurs sous jacents correspondants à des locuteurs et à des phonèmes. Nous observons qu’en utilisant en entrée seulement des banques de filtres logarithmiques, complexes et de grande dimension, le modèle récupère les facteurs utilisés pour la génération des données, et que deux variables, aux niveaux local et global, sont essentielles pour une reconstruction exacte et une représentation bien découplée. Sur TIMIT, un corpus de parole lue, en anglais, les biais proposés encouragent les représentations à découpler les locuteurs et les phonèmes, comme le montrent les résultats de classification obtenus en aval à l’aide d’un simple classificateur k-means non supervisé. L’optimisation conjointe de plusieurs variables latentes, avec chacune son biais propre, permet de découpler des facteurs sous-jacents qu’une seule variable ne peut représenter simultanément. Nous avons exploré quelques-uns des facteurs sous-jacents potentiellement utiles aux applications pour lesquelles peu ou pas de données annotées sont disponibles. L’approche proposée dans cette thèse, qui encourage un modèle génératif à apprendre des représentations interprétables et découplées, ouvre la porte à l’exploration d’autres facteurs et biais inductifs.
Date27 août 2020
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurPierre Dumouchel (Directeur(-trice))

Mots-clés

  • apprentissage non-supervisé
  • représentation distribuée
  • traitement de la parole
  • autoencodeur variationnel

Citer cette ressource

'