Le cri est le premier son qu’un bébé peut générer à la naissance, et qui est également un signe positif d’une nouvelle vie saine. Ainsi, le cri est tout ce qu’un nourrisson peut faire pour exprimer un quelconque malaise qu’il ressent. Nous pouvons alors nous demander : pourquoi un cri est-il un aspect important des soins de santé dispensés aux nouveau-nés ? Bien que les études sur les cris des nouveau-nés aient été initiées depuis la fin des années 1960, peu de travaux ont été réalisés en vue de l’identification automatique de pathologies à partir du cri.
Les rapports statistiques de l’Organisation mondiale de la santé indiquent que les anomalies congénitales ou malformations à la naissance affectent environ 1 nouveau-né sur 33 chaque année, et tous les décès d’enfants dans le monde ont majoritairement lieu dans les pays en développement. Il est donc impératif de fournir, aux pauvres mères dans les pays à bas revenu, un système économique de soins de santé qui aide leurs nouveau-nés à survivre au delà des premiers mois de la vie, sans avoir à recourir à des technologies complexes et avancées. Malgré le fait qu’il y ait beaucoup de problèmes de santé maternelle qui peuvent augmenter les risques des complications et des anomalies chez les nouveau-nés, nous sommes avides de savoir à quel point l’information dissimulée dans le cri pourrait permettre l’identification de l’anatomie physiologique ainsi que de la condition psychologique chez un nouveau-né. L’idée créative d’un tel système non invasif de diagnostic est basée sur les données probantes ressorties des recherches antérieures qui à leur tour révèlent la possibilité de distinguer entre enfants malades et enfants sains à partir du cri. Cette idée innovatrice peut aborder les principaux enjeux en matière de santé et de développement.
Le but de cette étude est de développer un système de diagnostic basé sur les cris afin de classifier les bébés sains et malades avec différents états pathologiques. D’abord, il est important de faire un choix précis des états pathologiques pour la phase de collection des cris des nouveau-nés. Cette opération est encore en cours pour compléter la base de données de cris. De plus, dans de nombreux domaines d’applications, il est souvent incontournable de disposer de données à très haute dimensionnalité et de taille d’échantillons réduite. Les problèmes de la taille des échantillons et de la réduction de la dimensionnalité ont fait l’objet des nombreuses recherches, mais l’association des données déséquilibrées et la taille réduite des échantillons réduite présente un nouveau défi pour la communauté. Dans cette situation, les algorithmes d’apprentissage échouent souvent à généraliser des règles inductives sur l’espace de l’échantillon et surtout lorsqu’ils sont employés avec cette forme de déséquilibre.
En effet, l’utilisation d’un échantillon, de taille réduite et de haute dimensionnalité, peut avoir un impact négatif sur l’apprentissage en raison de la difficulté dans la formation des relations par rapport au niveau déjà élevé des caractéristiques avec un nombre limité d’échantillons. Dans la partie qui suit, une étape de prétraitement des données, y compris la sélection et l’extraction des caractéristiques pathologiques appropriées avec la meilleure précision possible ainsi que leur quantification pour chaque pathologie, sans aucune intervention humaine, sera considérée pour l’élaboration de notre système. Afin d’exploiter l’information contenue dans le signal du cri, l’analyse des coefficients cepstraux sur l’échelle de Mels (MFCC) sera effectuée dans cette étude de façon séparée sur chacun des types de vocalisations expiratoire et inspiratoire du cri. En tenant compte de la nécessité d’éviter les efforts humains dans l’étiquetage des frontières dans le corpus utilisé, une étape de segmentation automatique des signaux de cris est requise pour un système de diagnostic idéal. Cependant, en vue d’alléger la tâche de segmentation dans cette étude, il était nécessaire jusqu’à présent de l’effectuer manuellement.
Les mélanges finis sont des outils de modélisation probabilistes, flexibles et puissants parmi toutes les approches disponibles. Elles permettent la modélisation et la de classification de données univariables et multivariables. Nous avons ainsi choisi d’utiliser les modèles de mélanges gaussiennes (GMM), qui représentent un cas particulier des Modèles de Markov cachés (HMMs) avec un seul état, pour la représentation des signaux cris selon les vecteurs de caractéristiques extraites. La partie suivante de cette thèse est dédiée à l’amélioration de l’apprentissage des GMMs. Cette étape est généralement réalisée à l’aide d’un algorithme itératif EM, pour Expectation-Maximisation. Cependant, compte tenu, d’une part, du risque du sur-apprentissage (overfitting) en raison de la petite taille de des échantillons de certaines conditions pathologiques, et d’autre part, du fait que le nombre de mélanges est fixé dans l’algorithme de ré-estimation traditionnelle EM, une nouvelle méthode d’apprentissage fondée sur un algorithme de ‘boosting’ est introduite afin d’entrainer les modèles de mélanges croissantes d’une façon incrémentale et récursive.
L’idée du modèle universel (UBM), largement employé dans les systèmes de reconnaissance du locuteur et de vérification, est utilisée pour représenter les caractéristiques principales des signaux de cris des nourrissons. Une variante de l’algorithme d’apprentissage appelée BML, pour Boosted Mixture Learning est employée, afin d’obtenir des modèles de chaque pathologie étudiée à partir d’un GMM-UBM par une adaptation des paramètres du GMM. L’essentiel dans la manipulation d’un système efficace de diagnostic est la fusion des deux sous-systèmes basés sur les vocalisations expiratoires et inspiratoires détectées dans les enregistrements des cris des bébés. De tels systèmes sont censés être plus fiables du fait de la présence de plusieurs éléments de preuve indépendants. En tenant compte de la compatibilité des caractéristiques et de la rigidité de la fusion, nous illustrons le rapport de fusion du Log-vraisemblance.
Indépendamment de toutes les méthodes d’apprentissage et de modélisation susmentionnées, notre travail se différencie des travaux antérieurs par le fait que dans les autres systèmes, une tâche binaire de classification est utilisée et qui sert à distinguer entre bébés sains et bébés malades ayant seulement une pathologie spécifique. Alors que notre système de diagnostic est fondé sur un schéma hiérarchique qui se focalise sur le problème de classification multipathologies via la fusion de divers classificateurs individuels. Par ailleurs, il convient de souligner que les pathologies sélectionnées n’ont pas été étudiées auparavant.
| Date | 8 juin 2015 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Chakib Tadj (Directeur(-trice)) |
|---|
- Nouveau-nés Maladies Diagnostic. Cris Classification. Traitement du signal. Distribution composée (Théorie des probabilités) Communication non-verbale chez le nourrisson. modèles de mélanges gaussiennes
- modèle universel (UBM)
- coefficients cepstraux
- rapport de vraisemblance
- cris des nouveau-nés
- expiration
- inspiration
Farsaie Alaie, H. (Auteur(e)),
Tadj (Directeur(-trice)),
8 juin 2015Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie