L’Alzheimer est une maladie neurodégénérative qui entraîne une détérioration progressive des fonctions cognitives et peut être observée par un déclin des fonctions langagières. Plusieurs chercheurs se sont tournés vers l’utilisation de processus informatiques automatisés permettant d’analyser des biomarqueurs provenant du langage et de détecter des signes de la maladie de manière non invasive. Au cours des cinq dernières années, le laboratoire d’ingénierie cognitive et sémantique (LiNCS) de l’école de technologie supérieure a contribué à cette recherche en mettant sur pied une application dédiée à l’extraction de caractéristiques linguistiques et à la classification de participants en fonction de la présence ou de l’absence de troubles cognitifs. Il demeure toutefois essentiel de pouvoir extraire et analyser des mesures pertinentes, les manipuler, les visualiser et s’appuyer sur un classificateur réutilisable et fiable.
Ce mémoire présente une solution qui s’appuie sur les travaux antérieurs du LiNCS et propose une application reconçue et améliorée. Notre approche met en place un système fiable, reposant sur des méthodes optimisées d’extraction de caractéristiques et mettant en place des outils pertinents de manipulation et de visualisation des données. Il explique l’observation de nouvelles caractéristiques significatives issues de l’analyse de trois catégories peu explorées dans la littérature : les chaînes de coréférence, les pauses et la complexité syntaxique. L’application comporte également un pipeline de classification optimisé utilisant un algorithme XGBoost comme base du modèle prédictif.
Les résultats obtenus à l’aide de notre système ont permis d’observer que les pauses courtes en début de phrase, les mesures de ratio de syntagmes ADVP, ADJP, VP, S et SBARQ, ainsi que les mesures de densité de syntagmes de types FRAG, VP, NP et ADJP, sont corrélées avec les étiquettes de diagnostic (F > 4, valeur p < 0,05) et contribuent à une meilleure classification. Nous avons également éliminé 17 caractéristiques générant du bruit et ayant été identifiées au moyen de notre outil. Le modèle de classification final a atteint un score F1 de 80,9% et un rappel de 80,5%, soit une amélioration respective de 5% et de 8,2% par rapport au modèle de base.
La conception de notre outil met en place un système performant permettant d’observer le déclin du langage et d’identifier des caractéristiques associées au diagnostic de la maladie d’Alzheimer. Il constitue une base solide pour la recherche et le développement futur et propose une application pouvant être utilisée par des professionnels de la santé pour suivre l’évolution des patients.
| Date | 3 sept. 2025 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Sylvie Ratté (Directeur(-trice)) & Pierre André Ménard (Codirecteur(-trice)) |
|---|
- maladie d’Alzheimer
- traitement automatique de la langue naturelle
- algorithme de classification
- chaînes de coréférence
- pauses
- complexité syntaxique
Gagné, C. M. (Auteur(e)),
Ratté (Directeur(-trice)) & Ménard (Codirecteur(-trice)),
3 sept. 2025Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie