Passer à la navigation principale Passer à la recherche Passer au contenu principal

End-to-end deep learning for audio classification: from waveforms to a security perspective

Traduction de l'intitulé de la thèse: Apprentissage profond de bout en bout pour la classification audio : des formes d’onde aux perspectives de sécurité
  • Sajjad Abdoli

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Le traitement audio est un problème majeur de l’apprentissage automatique. Les modèles d’apprentissage profond ont récemment eu un impact significatif sur les problèmes de traitement du son tels que la classification audio, la reconnaissance vocale ou l’identification du locuteur. La plupart des méthodes basées sur les modèles profonds reposent sur l’utilisation de représentations 2D comme les spectrogrammes. Ces méthodes sont inspirées des modèles d’apprentissage en profondeur conçus pour la vision par ordinateur et traitent les représentations 2D comme des images. Récemment, des modèles de traitement audio de bout en bout ont été développés pour traiter des signaux à une dimension. Dans ce cas, le signal audio brut, représenté par un vecteur 1D, est utilisé comme entrée des modèles profonds pour tirer pleinement parti du potentiel de ces modèles et éliminer les modules de traitement du signal habituellement utilisés pour extraire les caractéristiques des signaux audio. Cette étude explore comment les modèles profonds peuvent être utilisés pour le traitement audio, notamment, les problèmes de classification audio. Les méthodologies générales de traitement audio basées sur une extraction de caractéristiques prédéfinies de signaux audio bruts sont passées en revue. Une nouvelle architecture basée sur un réseau neuronal convolutif pour la classification des bruits environnementaux est proposée. Ce modèle élimine les modules de traitement du signal habituellement nécessaires pour l’extraction de caractéristiques prédéfinies et surpasse la plupart des approches existantes. Les résultats expérimentaux démontrent la puissance et le potentiel d’un tel modèle pour le problème de classification. De plus, des études récentes démontrent la vulnérabilité des modèles d’apprentissage en profondeur aux attaques adverses, qui menacent la fonctionnalité et la crédibilité de ces modèles. De telles menaces couvrent un large éventail d’objectifs tels que l’évasion, les données, l’empoisonnement du modèle ou l’extraction des caractéristiques. Cette étude explore ces attaques en se concentrant sur les forces et faiblesses des modèles de traitement audio de bout en bout. La perturbation adverse est l’une des attaques d’évasion et constitue une menace grave. Cette attaque injecte une perturbation quasi imperceptible dans l’échantillon d’entrée pour tromper le modèle, qui va mal le classer. Dans ce contexte, la perturbation adverse universelle est une perturbation adverse unique qui peut tromper le classificateur une fois ajoutée aux échantillons d’entrée. Dans cette étude, deux méthodes pour créer des perturbations audio adverses universelles sont proposées. Une méthode est inspirée d’un algorithme glouton itératif bien connu en vision par ordinateur, et l’autre est basée sur une nouvelle formulation de pénalité. Les résultats expérimentaux indiquent l’efficacité d’une telle perturbation pour tromper une famille de modèles ESC de reconnaissance vocale de bout en bout. À cet égard, des mécanismes défensifs et des stratégies d’atténuation appropriées doivent être envisagés pour concevoir et mettre en oeuvre de tels modèles.
Date21 déc. 2021
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurAlessandro Lameiras Koerich (Directeur(-trice)) & Patrick Cardinal (Codirecteur(-trice))

Mots-clés

  • l'apprentissage en profondeur
  • traitement audio
  • apprentissage automatique
  • perturbation adverse

Citer cette ressource

'