Passer à la navigation principale Passer à la recherche Passer au contenu principal

Amélioration des modèles basés sur Transformers pour le traitement des nombres dans les documents médicaux

  • Boammani Aser Lompo

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie

Résumé

Amélioration des modèles basés sur les Transformers pour le traitement des nombres dans les documents médicaux. Les documents médicaux créés par les professionnels de santé lors de l’admission des patients regorgent de détails essentiels pour le diagnostic. Cependant, leur potentiel n’est pas pleinement exploité en raison d’obstacles tels que le langage médical complexe, la compréhension insuffisante des données numériques médicales par les modèles du Language à la pointe de la technologie, et les limitations imposées par de petits jeux de données annotés. Ces recherches portent sur la classification des valeurs numériques extraites de documents médicaux en sept catégories physiologiques distinctes, en s’appuyant sur CamemBERT-bio, un modèle Transformer. Bien que certaines études antérieures aient suggéré que les modèles Transformers pouvaient être moins performants que les approches classiques en Traitement Automatique du Langage (TAL) pour ce type de tâche, des travaux plus récents montrent qu’une augmentation significative du nombre de paramètres permet aux modèles de langage d’acquérir de nouvelles compétences, améliorant ainsi leurs performances. Cependant, ces modèles de très grande envergure, appelés LLMs, nécessitent des ressources computationnelles considérables. Dans cette étude, nous nous concentrons sur des modèles de langage de taille intermédiaire basés sur l’architecture Transformer, comme CamemBERT-bio. Pour en optimiser les performances, notre approche repose sur deux phases. Tout d’abord, nous introduisons deux innovations principales : l’intégration d’embeddings de mots-clés dans le modèle et l’adoption d’une stratégie agnostique aux nombres en excluant toutes les données numériques du texte. La mise en oeuvre de techniques d’embedding de mots-clés affine les mécanismes d’attention, tandis que l’utilisation d’un jeu de données « aveugle aux nombres » vise à renforcer l’apprentissage centré sur le contexte. Un autre élément clé de notre recherche est de déterminer la criticité des données numériques extraites. Pour ce faire, nous avons utilisé une approche simple consistant à vérifier si la valeur se situe dans les plages standards établies. Résultats : Nos résultats sont encourageants, montrant des améliorations substantielles de l’efficacité de CamemBERT-bio, surpassant les méthodes conventionnelles avec un score F1 de 0,89. Cela représente une augmentation de plus de 20 % par rapport au score F1 de 0,73 des approches traditionnelles, avec un écart de seulement 6 % par rapport au score F1 de GPT-4, un modèle à la pointe de la technologie et plusieurs centaines de fois plus grand que le nôtre. Dans la deuxième phase, en s’appuyant sur les résultats antérieurs qui révèlent les limitations potentielles des modèles basés sur les transformateurs, nous examinons deux stratégies : le fine-tuning de CamemBERT-bio sur un petit jeu de données médicales avec l’intégration de l’Embedding de Label pour l’Attention de Soi (LESA), et la combinaison de LESA avec des techniques d’amélioration supplémentaires telles que Xval. Étant donné que CamemBERT-bio est déjà pré-entraîné sur un grand jeu de données médicales, la première approche vise à mettre à jour son encodeur avec la nouvelle technique d’embeddings de labels, tandis que la deuxième approche cherche à développer plusieurs représentations des nombres (contextuelles et basées sur la magnitude) pour obtenir des embeddings numériques plus robustes. Résultats : Comme prévu, le fine-tuning du CamemBERT-bio standard sur notre petit jeu de données médicales n’a pas amélioré les scores F1. Cependant, des améliorations significatives ont été observées avec CamemBERT-bio + LESA, entraînant une augmentation de plus de 15 %. Des améliorations comparables ont été observées en combinant LESA avec Xval, dépassant les méthodes classiques et réduisant encore l’écart de performance avec GPT-4, le modèle de référence à la pointe de la technologie. En résumé, notre travail a introduit diverses méthodes pour traiter les données numériques, qui sont également applicables à d’autres modalités. Nous illustrons comment ces nouvelles approches peuvent aider les modèles basés sur les transformers à fournir des performances robustes sur les tâches de classification, même lorsqu’ils traitent de petits jeux de données.
Date12 mai 2025
langue originaleFrançais
Établissement diplômant
  • École de technologie supérieure
SuperviseurRita Noumeir (Directeur(-trice)) & Philippe Jouvet (Codirecteur(-trice))

Mots-clés

  • traitement automatique du langage clinique
  • classification des valeurs numériques
  • entraînement des modèles linguistiques
  • embedding de labels pour l’attention de soi
  • Xval
  • unité de soins intensifs pédiatriques
  • patients en état critique

Citer cette ressource

'