Passer à la navigation principale Passer à la recherche Passer au contenu principal

Development of machine-learning-based natural language processing to detect concept labels in clinical narratives

Traduction de l'intitulé de la thèse: Développement d’algorithmes d’apprentissage machine pour le traitement du langage naturel afin de détecter certains concepts dans les récits cliniques
  • Thanh-Dung Le

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Une abondance de données et d’information est disponible dans le domaine clinique. Les cliniciens ont réussi à combiner les données informatives et structurées, qui comprennent les résultats de tests de laboratoire, l’imagerie médicale et les données de capteurs portables avec de nouveaux algorithmes analytiques pour offrir des soins de santé omniprésents et personnalisés. Cependant, les sources narratives cliniques, qui sont de courtes notes sur les patients, écrites par des médecins, posent des contraintes considérables. Bien que les notes sont fournies continuellement et stockées dans les entrepôts de données cliniques, elles sont peu utilisées en pratique réelle. La limitation provient principalement de leur format non structuré ou semi-structuré. Heureusement, le déploiement de l’apprentissage en profondeur au cours des dernières années aide à capturer efficacement la représentation cachée des récits cliniques, en raison de sa grande capacité de calcul. En particulier, l’amélioration des performances de l’apprentissage en profondeur sur les notes cliniques est continuellement renforcée par l’usage de techniques de traitement de langage naturel (NLP) lors du prétraitement des données. Le NLP devient une approche nécessaire pour surmonter les défis présents dans les notes de texte clinique non structurés, car cette étape peut efficacement mapper les mots dans les données non structurées dans un espace de dimension inférieure. Heureusement, une grande source de données de notes cliniques est actuellement stockée dans l’entrepôt de données de recherche au CHU Sainte-Justine (CHUSJ). Il y a 7 notes/patient/jour pour 1386 patients (contenant un ensemble de données de plus de 2,5 x 107 mots). Ces notes sont extraites de notes d’admission, notes d’évaluation et notes de synthèse. Les notes d’admission décrivent les raisons pour l’admission aux unités de soins intensifs, le progrès historique de la maladie, les médicaments donnés, la chirurgie et toutes autres données de base supplémentaires du patient. Les affections quotidiennes et les résultats des tests de laboratoire sont décrits dans les notes d’évaluation, desquels l’état du patient sera évalué et diagnostiqué plus tard par des médecins. Tous ces détails, de l’admission à la sortie d’un patient, sont résumés dans les notes de synthèse. Cependant, ces sources d’information sont utilisées comme documentation clinique pour les rapports et la facturation plutôt que servir comme connaissances cliniques antérieures pour prédire la progression de la maladie. Pour éviter la perte d’information scientifique contenue dans ces points de données, un algorithme de NLP basé sur l’apprentissage machine sera développé pour prédire l’état du patient en utilisant des notes cliniques stockées dans l’entrepôt de données de recherche à CHUSJ. L’algorithme proposé peut effectivement apprendre une représentation latente de notes cliniques pour en tirer une conclusion sur l’insuffisance cardiaque du patient, qui ne peut pas être décrite par une approche traditionnelle. Premièrement, notre étude fournit des informations importantes sur l’utilisation de modèles d’apprentissage automatique dans des ensembles de données limités. Plus précisément, nous avons constaté que des modèles plus petits et plus simples peuvent mieux fonctionner dans de tels contextes. À cette fin, notre cadre combine TF-IDF et MLP-NN, et nous démontrons que la sélection de caractéristiques à partir de l’espace vectoriel de représentation d’apprentissage peut encore améliorer les performances. Notre algorithme proposé apprend efficacement une représentation latente de notes cliniques pour conclure l’état d’insuffisance cardiaque d’un patient, que les approches traditionnelles ne peuvent pas décrire. Nous avons atteint une performance de classification globale avec une précision de 89%, un rappel de 88% et une précision de 89%. De plus, nous avons constaté que l’encodage des points décimaux sous forme de chaîne "DOT" aide à conserver les informations des valeurs numériques dans les notes cliniques, ce qui peut améliorer les performances du modèle. De plus, la thèse souligne qu’un facteur critique pour améliorer les performances des classificateurs d’apprentissage automatique dans le traitement clinique du langage naturel est le traitement approprié de la caractéristique de l’espace de représentation. Plus précisément, l’étude démontre que l’incorporation d’un auto-encodeur (AE) pendant la formation peut effectivement compresser l’espace des caractéristiques du modèle terme fréquence-fréquence de document inverse (TF-IDF), ce qui en fait un mécanisme efficace pour l’interprétabilité et la transparence dans le système CDSS. La deuxième étape consiste à utiliser un MLP-NN pour prédire l’état de santé en fonction de l’espace de fonctions compressé. Le modèle d’ensemble efficace atteint une précision de 92%, un rappel de 91%, une précision de 91% et un score f1 de 91%, surpassant toutes les approches alternatives. Enfin, bien que Transformer ait été largement reconnu comme l’approche de pointe en matière de traitement du langage naturel, il est toujours confronté à des limites lorsqu’il est appliqué à une PNL clinique courte et limitée. Nous proposons un cadre simplifié Switch Transformer que nous formons à partir de zéro sur un petit ensemble de données de classification de textes cliniques en français à l’hôpital CHU Sainte-Justine. Nos résultats montrent que les modèles simplifiés de transformateurs à petite échelle fonctionnent mieux que les modèles pré-formés basés sur BERT, tels que DisstillBERT, CamemBERT, FlauBERT et FrALBERT. Le cadre proposé atteint une précision de 87%, une précision de 87% et un rappel de 85%, ce qui surpasse le troisième meilleur modèle basé sur BERT pré-formé, FlauBERT, qui a atteint une précision de 84%, précision à 84 % et rappel à 84 %. Cependant, les transformateurs de commutation ont des limites, telles qu’un écart de généralisation et des minima nets. Pour répondre à ces limitations, nous le comparons à un réseau de neurones perceptrons multicouches pour la classification des petits récits cliniques français et montrons que ce dernier surpasse tous les autres modèles. Dans l’ensemble, l’étude démontre l’efficacité du cadre proposé et fournit des informations précieuses pour le développement de techniques de PNL en milieu clinique. Il améliore le processus long et coûteux de traitement des maladies, les interventions de santé et la gestion de la prévention à l’unité de soins intensifs pédiatriques de l’hôpital CHUSJ.
Date12 sept. 2023
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurRita Noumeir (Directeur(-trice)) & Philippe Jouvet (Codirecteur(-trice))

Mots-clés

  • traitement clinique du langage naturel
  • insuffisance cardiaque
  • apprentissage automatique
  • apprentissage par déséquilibre
  • sélection de fonctionnalités

Citer cette ressource

'