En général, les entreprises oeuvrant dans l’industrie des systèmes de dialogue homme-machine offrent plusieurs applications informatiques à leurs clients, dont la compréhension automatique du langage naturel. Les systèmes courants de dialogue humain-machine sont constitués de trois composants faiblement couplés :
-Le système de reconnaissance vocale (ASR);
-Le système de compréhension du langage naturel (NLU);
-Le système de dialogue ou agent conversationnel (CA).
Dans cette architecture, les sorties des composants précédents servent d’entrées aux composants suivants. Les caractéristiques du signal acoustique ne font pas partie de la sortie du premier composant. Il est possible qu’il y ait de l’information supplémentaire dans le signal original pouvant aider directement le système NLU à effectuer sa tâche. Cette information dite « prosodique » concerne l’intonation, l’intensité et la durée des sons, qui est évidemment absente du texte écrit. Par exemple, l’identification d’un texte libre présent dans une commande vocale est particulièrement difficile pour le système NLU actuel. La littérature n’aborde pas directement l’identification des textes libres. Le concept le plus similaire étant l’identification des citations. L’originalité de cette étude est que l’auteur de la citation et son narrateur correspondent à la même entité.
L’objectif primaire de cette étude consistait à déterminer s’il existait une corrélation entre l’information prosodique d’un signal acoustique et la présence ou non des textes libres. Trois types de caractéristiques prosodiques ont été extraits à partir d’un grand ensemble de commandes vocales. Ces extractions ont permis de générer des distributions de leurs mesures. Les distributions des textes libres ont été comparées par rapport à celles des autres concepts, grâce au test de Kolmogorov–Smirnov (test K-S) à deux échantillons. Les résultats ont indiqué qu’il existait effectivement une corrélation. L’objectif secondaire consistait à vérifier s’il était possible d’améliorer les performances d’un système NLU grâce à cette information prosodique. Un système NLU minimal a été utilisé. Pour vérifier les gains de performance, des modèles basés sur des caractéristiques lexicales seules ont été comparés par rapport à des modèles augmentés par des caractéristiques prosodiques. Le test de McNemar a été utilisé pour vérifier si les gains obtenus étaient significatifs. L’information prosodique a effectivement amélioré les performances du système.
| Date | 27 juin 2016 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Pierre Dumouchel (Directeur(-trice)), Réal Tremblay (Codirecteur(-trice)) & Patrick Cardinal (Codirecteur(-trice)) |
|---|
- Traitement automatique des langues naturelles. Prosodie (Linguistique) Reconnaissance automatique de la parole. texte libre
- Kolmogorov-Smirnov
- compréhension du langage naturel
Boutin, S. (Auteur(e)),
Dumouchel (Directeur(-trice)), Tremblay (Codirecteur(-trice)) &
Cardinal (Codirecteur(-trice)),
27 juin 2016Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie des technologies de l'information