Passer à la navigation principale Passer à la recherche Passer au contenu principal

Enhancement of speech signals using neural networks with spectral subtraction

Traduction de l'intitulé de la thèse: Amélioration des signaux vocaux à l’aide de réseaux neuronaux et de la soustraction spectrale
  • Amirarsalan Darabpour

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie électrique

Résumé

Aujourd’hui, de nombreux domaines et moyens de communication tels que les télécommunications, la reconnaissance vocale et les systèmes audiovisuels utilisent l’amélioration de la parole comme moyen d’améliorer la qualité des signaux vocaux, généralement en réduisant le niveau de bruit de fond. Les signaux vocaux contiennent souvent un bruit sous-jacent, provenant soit du processus d’acquisition, soit du canal de transmission. Ces dernières années, des recherches importantes ont été menées dans le domaine de l’amélioration de la qualité de la parole à l’aide de techniques d’apprentissage automatique. Ces techniques ont été utilisées dans de nombreuses taches de traitement de la parole car elles ont donné des résultats très satisfaisants. Par conséquent, dans cette thèse, l’objectif principal de notre projet a été d’améliorer les signaux vocaux, en utilisant un cadre base sur l’apprentissage automatique à l’aide de réseaux neuronaux. Les signaux vocaux sont composés de segments voises et non voises et dans l’amélioration de la parole, la classification des segments voisés et non voises d’un signal vocal est une tâche importante car elle permet d’améliorer les signaux vocaux de manière ciblée. Notre modèle utilise un algorithme avec un processus de fenêtrage qui améliore sa précision par rapport aux autres méthodes. Il s’agit de diviser le signal d’entrée en trames ou fenêtres de courte durée et d’analyser chaque fenêtre séparément pour déterminer si elle contient un signal de parole ou de non-parole. Notre cadre base sur les réseaux neuronaux a été mis en œuvre afin de remplir deux taches fondamentales. La première consiste à classer les signaux voises et non voises et la seconde à améliorer les signaux voises et non voises afin d’obtenir un signal vocal amélioré. Pour réaliser la classification, nous avons utilisé l’ensemble de données NOIZEUS pour entrainer nos modèles. Nous avons développé avec succès un cadre complet qui classifie les segments voises et non voises des signaux vocaux bruyants. L’amélioration repose sur un critère base sur le type de chaque fenêtre. Cette approche nous permet d’appliquer des méthodes d’amélioration spécifiques a différents segments, ce qui permet d’obtenir un signal final entièrement amélioré et debruité. Nos résultats ont montré que le système de classification des signaux voisés et non voisés ainsi que notre stratégie de nettoyage des signaux corrompus par du bruit additif ont été très efficaces, permettant d’obtenir un signal vocal réellement amélioré en termes de rapport signal/bruit et de qualité d’écoute.
Date8 avr. 2024
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurGheorghe Marcel Gabrea (Directeur(-trice))

Mots-clés

  • amélioration de la parole
  • réseaux de neurones
  • soustraction spectrale
  • classification de la parole et de la non-parole

Citer cette ressource

'