Passer à la navigation principale Passer à la recherche Passer au contenu principal

Utilisation des caractéristiques prosodiques pour optimiser un système de compréhension du langage naturel

  • Simon Boutin

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie des technologies de l'information

Résumé

En général, les entreprises oeuvrant dans l’industrie des systèmes de dialogue homme-machine offrent plusieurs applications informatiques à leurs clients, dont la compréhension automatique du langage naturel. Les systèmes courants de dialogue humain-machine sont constitués de trois composants faiblement couplés : -Le système de reconnaissance vocale (ASR); -Le système de compréhension du langage naturel (NLU); -Le système de dialogue ou agent conversationnel (CA). Dans cette architecture, les sorties des composants précédents servent d’entrées aux composants suivants. Les caractéristiques du signal acoustique ne font pas partie de la sortie du premier composant. Il est possible qu’il y ait de l’information supplémentaire dans le signal original pouvant aider directement le système NLU à effectuer sa tâche. Cette information dite « prosodique » concerne l’intonation, l’intensité et la durée des sons, qui est évidemment absente du texte écrit. Par exemple, l’identification d’un texte libre présent dans une commande vocale est particulièrement difficile pour le système NLU actuel. La littérature n’aborde pas directement l’identification des textes libres. Le concept le plus similaire étant l’identification des citations. L’originalité de cette étude est que l’auteur de la citation et son narrateur correspondent à la même entité. L’objectif primaire de cette étude consistait à déterminer s’il existait une corrélation entre l’information prosodique d’un signal acoustique et la présence ou non des textes libres. Trois types de caractéristiques prosodiques ont été extraits à partir d’un grand ensemble de commandes vocales. Ces extractions ont permis de générer des distributions de leurs mesures. Les distributions des textes libres ont été comparées par rapport à celles des autres concepts, grâce au test de Kolmogorov–Smirnov (test K-S) à deux échantillons. Les résultats ont indiqué qu’il existait effectivement une corrélation. L’objectif secondaire consistait à vérifier s’il était possible d’améliorer les performances d’un système NLU grâce à cette information prosodique. Un système NLU minimal a été utilisé. Pour vérifier les gains de performance, des modèles basés sur des caractéristiques lexicales seules ont été comparés par rapport à des modèles augmentés par des caractéristiques prosodiques. Le test de McNemar a été utilisé pour vérifier si les gains obtenus étaient significatifs. L’information prosodique a effectivement amélioré les performances du système.
Date27 juin 2016
langue originaleFrançais
Établissement diplômant
  • École de technologie supérieure
SuperviseurPierre Dumouchel (Directeur(-trice)), Réal Tremblay (Codirecteur(-trice)) & Patrick Cardinal (Codirecteur(-trice))

Mots-clés

  • Traitement automatique des langues naturelles. Prosodie (Linguistique) Reconnaissance automatique de la parole. texte libre
  • Kolmogorov-Smirnov
  • compréhension du langage naturel

Citer cette ressource

'