Les pleurs du nouveau-né sont généralement dus à diverses conditions liées à la physiologie, à la pathologie ou à l'émotion. À cet égard, différents modèles de signaux de cri du nouveau-né sont associés à son état de santé. En conséquence, divers systèmes de diagnostic assisté par ordinateur ont été proposés pour distinguer automatiquement les signaux de cris d'un nouveauné sain et malsain. Ces systèmes automatiques utilisent des techniques spécifiques de traitement du signal combinées à l'apprentissage automatique pour l'analyse et la classification des signaux de cris du nouveau-né avec une précision acceptable.
L'objectif principal de notre étude est de concevoir de nouveaux systèmes de diagnostic assisté par ordinateur basés sur une combinaison de traitement du signal et d'apprentissage profond pour améliorer la précision de la distinction entre les signaux de cris d'un nouveau-né sain et malsain. De plus, nous étudions la complexité de ces signaux sur la base des fractales, de l'entropie et des multi-fractales afin de mieux comprendre les différences de dynamique non linéaire des signaux de cri d'un sujet à l'autre.
Pour la classification automatique des signaux de cris du nouveau-né, nous avons entraîné divers systèmes d'apprentissage profond (notamment les réseaux neuronaux à rétroaction profonde, à convolution, et à mémoire à long terme et à court terme) avec des informations basées sur l’analyse du cepstre. Nous avons également utilisé la méthode d'optimisation bayésienne pour optimiser les hyperparamètres des machines à vecteurs de support avec fonction à base radiale et l’algorithme du k plus proche voisins (kNN), tous deux entraînés avec différentes caractéristiques audio-acoustiques séparément ou combinées, sélectionnées à l'aide d'un filtre statistique. Pour l'analyse de la complexité, nous avons utilisé la dimension de corrélation, l'entropie approximative et les leaders d'ondelettes.
Dans la tâche de classification automatique des signaux de cris du nouveau-né en utilisant les coefficients du cepstre, nous avons constaté que (a) le réseau neuronal à action directe profonde (DFNN) atteignait un taux de classification correcte très proche de la perfection lorsqu'il était appliqué aux signaux de cris d'expiration du nourrisson et donnait une performance parfaite lorsqu'il était appliqué aux signaux de cris d'inspiration du nourrisson, (b) DFNN a surpassé les systèmes SVM linéaires et Naïve Bayes lorsqu'ils ont été testés à la fois sur les ensembles d'expiration et d'inspiration, (c) DFNN a surpassé les travaux très récents publiés dans la littérature, (d) les réseaux neuronaux à convolution (CNN) ont surpassé DFNN et les systèmes à long et courte mémoire (LSTM), et (e) les systèmes d'apprentissage profond entrainés avec des descripteurs du cepstre ont obtenu le meilleure taux de classification correcte par rapport aux études similaires dans la littérature.
Dans la tâche de la classification des signaux de cris de nouveau-nés sains et malsains sur la base des caractéristiques acoustiques, nous avons constaté que (a) le SVM entraîné avec des caractéristiques de modulation d'amplitude d'inspiration auditive (AAM) atteignait le taux de classification correcte le plus élevé, suivi par l'algorithme kNN entraîné avec une combinaison de fréquences des coefficients cepstrales (MFCC), AAM et prosodie, et (b) SVM a surpassé en terme de performance la plupart des travaux existants validés sur la même base de données tout en étant considérablement rapide à exécuter.
Dans la tâche de caractérisation des signaux de cris de nouveau-nés sains et malsains à l'aide de mesures de complexité, nous avons constaté que (a) il existe des différences significatives dans l'entropie approximative et la dimension de corrélation entre les deux catégories de patients, (b) les signaux de cris de nourrissons en bonne santé présentent un niveau d'entropie approximatif plus élevé que ceux des nourrissons pathologiques, (c) les signaux de cris des nourrissons en bonne santé présentent un niveau de dimension de corrélation plus élevé que ceux des nourrissons pathologiques, et (d) les cris des nouveau-nés en bonne santé présentent un degré de multi-fractal plus élevé que ceux en mauvaise santé.
En résumé, les systèmes d'apprentissage profond formés avec des descripteurs de cepstre sont prometteurs pour l'analyse et le diagnostic des signaux de cris du nourrisson en milieu clinique. De même, le SVM non linéaire optimisé à l'aide de l'optimisation bayésienne et entraîné par des caractéristiques sélectionnées basées sur le chi-carré de MFCC, AAM, prosodie ou combinaison de ces caractéristiques sélectionnées, peut être prometteur pour le diagnostic des nouveau-nés en milieu clinique. Cependant, l’apprentissage profond permet d’atteindre les plus hautes performances.
Enfin, l’entropie approximative et la dimension de corrélation basées sur le cepstre peuvent être considérées comme des biomarqueurs et pourraient potentiellement aider à comprendre la physiologie des cris du nouveau-né et être utilisées à des fins de diagnostic.
| Date | 11 avr. 2025 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Chakib Tadj (Directeur(-trice)) & Christian Gargour (Codirecteur(-trice)) |
|---|
- cri du nouveau-né
- traitement de signal
- cepstrum
- acoustique
- apprentissage machine
- apprentissage profond
- sélection de caractéristiques
- classification
Lahmiri, S. (Auteur(e)),
Tadj (Directeur(-trice)) & Gargour (Codirecteur(-trice)),
11 avr. 2025Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie