La segmentation d’images médicales est une étape de pré-traitement importante dans les systèmes de diagnostic assisté par ordinateur. Les méthodes basées sur les réseaux de neurones ont démontré des performances de pointe sur diverses tâches de segmentation avec différentes modalités d’image. Malgré leur succès sans précédent, les réseaux de neurones nécessitent généralement une grande quantité de données étant étiquetées avec précision. Cependant, obtenir ces données est un processus laborieux et coûteux qui nécessite souvent l’intervention d’un expert médical, et les annotations sont sujettes aux erreurs. Pour mitiger la rareté des images densément annotées, une direction prometteuse de recherche consiste à exploiter des images avec des signaux de supervision réduits. Ces supervisions réduites se composent généralement d’une étiquette d’image, des points, des traits ou des boîtes englobantes comme annotation, cependant des images sans aucune information supervisée peuvent également être employées. De plus, des recherches récentes ont également tenté de combiner ces annotations faibles avec des a priori anatomiques de régions d’intérêt pour guider la prédiction du réseau vers des solutions anatomiquement plausibles.
L’objectif principal de cette thèse est de développer des algorithmes précis pour la segmentation d’images médicales, pouvant apprendre avec une supervision réduite. Plus précisément, nous proposons d’abord un algorithme de segmentation faiblement supervisé, apprenant à partir de traits et de contraintes anatomiques discrètes. Ensuite, nous présentons une approche de segmentation basée sur l’apprentissage par ensemble, permettant l’entraînement collaboratif de plusieurs réseaux de segmentation avec un nombre limité d’images étiquetées et une plus grande quantité d’images non étiquetées. Dans une autre contribution de la thèse, nous résolvons ce problème en introduisant un algorithme basé sur l’information mutuelle, qui emploi des images non étiquetées pour régulariser la représentation apprise par le réseau et augmente la précision de la segmentation lorsque peu d’images sont densément annotées. Par la suite, nous proposons une méthode basée sur l’apprentissage de la représentation qui exploite l’information d’images médicales non annotées avec des méta-étiquettes. Enfin, nous démontrons une méthode de maximization de l’information sensible aux contours pour le pre-entraînement des représentations denses du réseau, pouvant exploiter l’information sur les structures anatomiques d’images non étiquettées and ainsi améliorier de manière significative la précision de segmentation étant donné un petit ensemble d’images annotées. Cette thèse a donné lieu à trois articles de revues, deux articles dans des conférences avec comité de lecture, deux articles dans des séminaires en imagerie médicale, ainsi qu’à un article en cours d’évaluation. Les objectifs spécifiques de cette thèse sont présentés ci-dessous.
Comme premier objectif, nous proposons une stratégie efficace de segmentation faiblement supervisée pour imposer des contraintes ou des a priori de régularisation sur les régions cibles. Cette méthode de segmentation est une des premières à employer une optimisation discrète avec un réseau de neurones, ce qui lui permet d’obtenir une solution plus rapidement et avec une plus grande précision. La méthode proposée repose sur l’algorithme de la méthode des multiplicateurs à direction alternée (ADMM) et entraîne un CNN avec des contraintes discrètes et des a priori de régularisation. La performance de cette méthode est validée sur la segmentation d’images médicales n’ayant que quelques pixels annotés, ainsi que des contraintes discrètes sur la taille et la régularité des frontières de régions à segmenter. Des expériences sur deux jeux de données de référence démontrent que notre méthode apporte des améliorations significatives par rapport aux approches existantes en termes de précision de segmentation, de satisfaction des contraintes et de vitesse de convergence.
Dans notre deuxième objectif, nous nous concentrons sur la segmentation semi-supervisée et proposons un algorithme basé sur l’apprentissage par ensemble. Cet algorithme entraîne plusieurs modèles avec un nombre réduit d’images annotées, ainsi que des images non annotées servant à échanger des informations entre les modèles. Afin d’assurer la diversité des modèles, une fonction de perte antagoniste est conçue. L’efficacité de notre méthode est démontrée sur trois tâches de segmentation d’images médicales couvrant différentes modalités, où celle-ci augmente la précision de segmentation lorsque très peu d’images étiquetées sont utilisées. L’effet de notre perte de diversité est également étudié en visualisant les images générées lors de l’entraînement antagnoiste. Nous explorons aussi le gain de performance obtenu avec un ensemble ayant plus de deux modèles, montrant que l’ajout de modèles améliore les résultats au coût de calculs accrus.
Dans notre troisième objectif, une nouvelle méthode de segmentation semi-supervisée est proposée. Cette méthode tire parti de l’information mutuelle sur les distributions catégorielles pour obtenir à la fois une invariance de représentation globale et une régularité spatiale de la segmentation. Dans cette méthode, nous maximisons l’information mutuelle pour les caractéristiques intermédiaires qui sont extraites à la fois de l’encodeur et du décodeur d’un réseau de segmentation. Une perte sur l’information mutuelle globale est employée sur l’encodeur pour favoriser l’invariance par rapport à des transformations géométriques sur les images d’entrée. De même, une perte sur l’information mutuelle locale est proposée pour encourager la cohérence spatiale dans les cartes de caractéristiques du décodeur, et ainsi fournir une segmentation plus régulière. Les avantages de notre méthode sont évalués sur quatre bases de données publiques pour la segmentation d’images médicales. Les résultats expérimentaux montrent que notre méthode surpasse les approches récentes de segmentation semi-supervisée, et fournit une précision proche de celle obtenue avec une supervision complète, tout en nécessitant très peu d’images annotées.
Dans notre quatrième objectif, nous visons à obtenir une représentation utile à partir d’images non étiquetées. Plus précisément, nous adaptons l’apprentissage contrastif pour entraîner l’encodeur du réseau dans différentes tâches prédéfinies: déterminer si deux images d’un volume IRM proviennent de la même position, de la même personne, ou si celles-ci ont été acquises au même instant du cycle cardiaque. Afin d’atténuer le bruit présent dans ces méta-étiquettes, une stratégie efficace d’apprentissage auto-rythmée est ensuite proposée pour l’apprentissage contrastif, ce qui se traduit par une représentation plus robuste et donc des améliorations en performance pour les tâches de segmentation. Nous vérifions la qualité de la méthode proposée sur cinq jeux de données portant sur la segmentation d’images médicales, indiquant clairement l’avantage de notre mécanisme d’apprentissage auto-rythmé utilisant les méta-étiquettes.
Enfin, le dernier objectif spécifique de cette thèse présente une méthode basée sur le partitionnement de données pour apprendre une représentation discriminative pour les cartes de caractéristiques denses du réseau. Cette approche utilise une perte d’information mutuelle améliorée pour regrouper les caractéristiques denses en plusieurs partitions équilibrées et confiantes. Une perte sensible aux contours, basée sur la corrélaion croisée au niveau de pixels, est également utilisée pour aligner les régions de haute entropie du partitionnement avec les arêtes dans l’image, ce qui force les différentes partitions à correspondre aux structures anatomiques présentes dans l’image. Nos pertes proposées complémentent la perte contrastive supervisée présentée dans l’objectif précédent, et leur combinaison conduit à d’improtantes améliorations de performance pour la segmentation. Les résultats expérimentaux obtenus à partir de deux jeux de données cliniquement pertinents indiquent clairement l’avantage de notre méthode par rapport aux approches existantes à base d’apprentissage contrastif, conduisant à une précision de segmentation proche de celle de la supervision complète, mais avec seulement quelques exemples densément annotés.
| Date | 9 juin 2022 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Christian Desrosiers (Directeur(-trice)) & Marco Pedersoli (Codirecteur(-trice)) |
|---|