Passer à la navigation principale Passer à la recherche Passer au contenu principal

Automatic audio anonymization

Traduction de l'intitulé de la thèse: Anonymisation automatique de l’audio
  • Guillaume Baril

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie des technologies de l'information

Résumé

L’anonymisation de données est souvent une tâche réalisée par des humains. L’automatiser permettrait de réduire le coût et le temps requis pour réaliser cette tâche. Dans ce travail, on montre que l’anonymisation de données audio en français peut être automatisée. On propose un pipeline qui prend en entrée des fichiers audio avec leurs transcriptions et qui brouille les entités nommées présent dans l’audio. Notre pipeline est formé de deux composantes. La première composante est l’aligneur qui va aligner les mots de la transcription avec l’audio et la deuxième composante est le modèle qui effectue la reconnaissance d’entités nommées. Ensuite, on remplace l’audio correspondant aux entités nommées par un silence. On a comparé plusieurs aligneurs et plusieurs modèles afin de trouver les meilleurs pour notre scénario. On a testé notre pipeline sur une petite base de données annotée à la main et on a obtenu un score F1 de 76.9%. Ce résultat prouve qu’automatiser cette tâche est réalisable. Par contre, en ayant un jeu de données plus grand, il serait possible d’obtenir de meilleurs résultats, d’entraîner le modèle à reconnaître de nouvelles entités nommées et d’entraîner un modèle bout-en-bout qui obtiendrait probablement de meilleurs performances qu’un pipeline avec des composantes entraînées séparément.
Date17 déc. 2021
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurPatrick Cardinal (Directeur(-trice)) & Alessandro Lameiras Koerich (Codirecteur(-trice))

Mots-clés

  • désidentification de l’audio
  • traitement du langage naturel
  • reconnaissance d’entités nommées
  • alignement forcé
  • apprentissage profond

Citer cette ressource

'