Passer à la navigation principale Passer à la recherche Passer au contenu principal

Computer-based identification of relationships between medical concepts and cluster analysis in clinical notes

Traduction de l'intitulé de la thèse: Identification informatique des relations entre les concepts médicaux et l’analyse par grappes dans les notes cliniques
  • Ruth Maria Reátegui Rojas

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Les textes cliniques contiennent des informations variées qui mettent en relief des concepts médicaux ou des entités; on y trouve des formes de surface et des codes qui correspondent entre autres à des maladies, des traitements et des médicaments. Ces dernières –les entités– donnent au clinicien une impression générale et exhaustive de la santé du patient. L’analyse automatique de cette information riche est pertinente pour les experts et les chercheurs de la santé afin d’identifier des associations parmi les entités médicales. Cependant, l’extraction automatique d’information à partir des textes cliniques constitue un défi à cause de leur format narratif et leur structure libre. Cette recherche décrit un processus pour extraire de manière automatique des entités médicales afin d’identifier des grappes de patients ainsi que les relations entre les maladies et les traitements. L’ensemble de données i2b2 2008 Obesity a été utilisé. Cet ensemble de données est composé de 1237 résumés sur le surpoids et les patients diabétiques, donc ce travail fixe son regard sur les maladies liées à l’obésité. Pour l’extraction automatique des entités médicales, les outils MetaMap et cTAKES ont été utilisés pour comparer leur capacité d’extraction automatique. Les modules du Unified Medical Language System ont été mis à contribution pour ajouter des informations à propos des entités extraites. Pour l’identification des grappes de patients, deux approches sont proposées. Premièrement, l’algorithme de groupement K-moyen disperses est appliqué sur une matrice patient-maladie comportant 14 comorbidités liées à l’obésité. Deuxièmement, pour visualizer et analyser d’autres maladies présentes sur les données cliniques, 86 maladies ont été utilisées pour former des grappes selon une approche fondée sur des graphes. Les graphiques bipartites obtenus ont permis d’explorer les relations maladie-traitement corrélées avec les principals grappes obtenues. Le résultat des expérimentations a montré que cTAKES est préférable à MetaMap, mais que cette situation peut changer si l’on modifie les choix de configuration des outils – les listes d’abréviations par exemple. De surcroît, l’ajout de concepts (avec des types sémantiques similaires ou différents) s’avère une bonne stratégie pour améliorer l’acquisition automatique d’entités médicales à partir de textes cliniques. L’algorithme K-moyen disperses a distingué trois types de grappes (élevée, moyenne et basse); ces groupes ont été identifiés en fonction du nombre de comorbidités et du pourcentage de patients affectés par elles. Ces résultats montrent que le diabète, l’hypercholestérolémie, la maladie cardiovasculaire, l’insuffisance cardiaque congestive, l’apnée obstructive pendant le sommeil, et la dépression sont les maladies les plus répandues. La construction des graphes a permis de visualiser et d’analyser l’information des patients; elle a permis l’identification de trois sous-graphes: des patients obèses avec des problèmes de métabolisme, des patients obèses avec problèmes infectieux, et des patients obèses avec des problèmes mécaniques. Les graphes bipartites pour une relation maladie-traitement mettent ainsi en relief les traitements pour différents types de maladie, les patients obèses souffrant de multiples troubles de santé. Cette thèse confirme que les textes narratifs cliniques en forme libre constituent une source d’information très riche qui peut être utilisée pour explorer, visualiser, et analyser l’information des patients grâce à une méthode automatisée. D’autres travaux sont nécessaires pour explorer la relation entre les différentes entités médicales des textes cliniques et les autres ensembles de données médicales. L’aspect temporel des données devrait également être considéré dans de futurs travaux afin de former un portrait personnalisé des grappes, des maladies et des patients.
Date4 avr. 2019
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurSylvie Ratté (Directeur(-trice))

Mots-clés

  • analyse par grappes
  • approche basée sur les réseaux
  • k-moyennes disperses
  • données cliniques
  • obésité

Citer cette ressource

'