Passer à la navigation principale Passer à la recherche Passer au contenu principal

Modèle d’amélioration des transcriptions automatiques des narrations de patients dans le contexte restreint des tâches de description d’images

  • Eric Ulises García Cano Castillo

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie des technologies de l'information

Résumé

La reconnaissance automatique de la parole (ASR, selon son acronyme anglais) est une technologie largement utilisée dans la vie quotidienne, mais qui n'est pas complètement résolue. Les systèmes ASR sont toujours sujets à des erreurs, surtout lorsqu'ils sont confrontés à des conditions non standard, différentes de celles utilisées pour les entraîner. Cette technologie est particulièrement mise à l'épreuve lorsqu'elle est utilisée avec la parole de nonanglophones et de personnes âgées. Dans le domaine de l'étude des maladies neurodégénératives, on sait que les troubles du langage apparaissent à des stades précoces de la maladie et que l'analyse du discours narratif des patients permet d'obtenir un diagnostic opportun. L'analyse manuelle, telle qu'elle est réalisée jusqu'à présent, est coûteuse en termes de temps et de ressources. La reconnaissance automatique de la parole pourrait donc rendre le processus plus efficace. Cependant, les taux d'erreur élevés de ces systèmes les empêchent d'être largement utilisés dans la science et la recherche. Dans cet article, nous proposons une nouvelle méthode de postédition de détection et de correction des erreurs pour un système ASR qui génère des transcriptions automatiques de la parole d'adultes et de personnes âgées francophones décrivant une image. Au moyen de techniques de traitement du langage naturel, nous extrayons le vocabulaire le plus courant des transcriptions manuelles correctes pour construire un dictionnaire de correction phonémisé ; ensuite, nous extrayons des phrases hors contexte des transcriptions automatiques, qui sont ensuite comparées par une recherche phonétique floue avec le dictionnaire de correction, pour trouver et appliquer les meilleures corrections. Les résultats expérimentaux montrent une précision de détection des erreurs de 80 % et notre meilleur modèle permet une amélioration moyenne du WER de 1,9 %, avec des valeurs allant de 0,6 % à 6,4 %.
Date26 janv. 2022
langue originaleFrançais
Établissement diplômant
  • École de technologie supérieure
SuperviseurSylvie Ratté (Directeur(-trice))

Mots-clés

  • reconnaissance automatique de la parole
  • détection d'erreurs ASR
  • correction d'erreurs ASR
  • voix vieillissante
  • adulte âgé
  • langue française

Citer cette ressource

'