La surveillance des signes vitaux dans les Unités de Soins Intensifs Pédiatriques (USIP) est essentielle pour la prise en charge des patients pédiatriques vulnérables. Les approches conventionnelles, telles que l’électrocardiographie, reposent sur un contact physique et sont souvent invasives, coûteuses et inadaptées aux nouveau-nés ou aux patients atteints de maladies contagieuses. La photopléthysmographie à distance (rPPG) offre une alternative sans contact en capturant les variations subtiles de la couleur de la peau causées par le flux sanguin pulsatile. En soins intensifs pédiatriques, elle constitue une solution plus sûre que les capteurs adhésifs, qui peuvent provoquer des irritations et augmenter le risque d’infection. Cependant, le déploiement de la rPPG dans des environnements cliniques réels reste difficile en raison des occlusions fréquentes dues à l’équipement médical, des mouvements des patients, de la variabilité de l’éclairage et d’un décalage de domaine entre les données de laboratoire contrôlées et les enregistrements en USIP. Ces limitations sont aggravées par la rareté des ensembles de données cliniques annotées. Pour surmonter ces contraintes, il est nécessaire de développer des modèles physiologiquement interprétables, efficaces sur le plan computationnel et résilients aux changements de domaine. Cette thèse présente un cadre unifié qui intègre l’apprentissage de caractéristiques spatiotemporelles efficaces, la détection de régions anatomiquement cohérentes et un pré-entraînement auto-supervisé basé sur un curriculum pour obtenir une estimation précise et en temps réel de la fréquence cardiaque dans des environnements cliniques complexes.
Pour extraire des signaux rPPG fiables à partir de vidéos faciales non contraintes, une architecture hybride est proposée, combinant des blocs convolutionnels 3D avec des noyaux de différence temporelle (3DCDC-T) et une auto-attention multi-têtes issue des transformateurs de vision. Le modèle capture les gradients spatiotemporels locaux indicatifs des variations du volume sanguin tout en modélisant les dépendances à plus longue portée nécessaires pour résoudre les cycles cardiaques complets. Les mécanismes d’attention affinent davantage la focalisation des caractéristiques sur les régions faciales physiologiquement informatives, et la conception feed-forward garantit l’efficacité computationnelle en limitant l’entrée du transformateur à des plongements de caractéristiques compacts. Évalué sur des ensembles de données publics, le modèle atteint une MAE de 0,79 bpm et une RMSE de 0,80 bpm, avec une corrélation de Pearson de 0,99, améliorant ainsi les méthodes existantes tant en termes de précision que de coût d’inférence.
Une estimation précise de la rPPG nécessite un suivi anatomique stable des régions du visage et thoraco-abdominales, en particulier dans les vidéos affectées par la rotation, l’inclinaison du lit ou l’occlusion par le personnel soignant. Un module de détection dédié est développé en utilisant le modèle Divided Space–Time Mamba (DST-Mamba). Cette architecture découple le traitement spatial et temporel grâce à des Modèles d’Espace d’État Sélectifs (SSM), permettant une complexité en temps linéaire et une inférence à faible latence sur des séquences vidéo plus longues. Le modèle prédit des boîtes englobantes orientées (OBB) pour préserver l’alignement en rotation sous des angles de caméra non standards et intègre des entrées RGB-D pour améliorer la robustesse face aux occlusions visuelles. DST-Mamba atteint 0,96 mAP@0,5 et 0,95 d’IoU tournée sur un ensemble de données cliniques, maintenant la stabilité temporelle tout en fonctionnant à 23 FPS sur du matériel standard.
Pour pallier la rareté des données étiquetées en USIP, une stratégie d’apprentissage auto-supervisé basée sur un curriculum est introduite. Un contrôleur de masquage adaptatif basé sur Mamba attribue des scores d’importance spatiotemporelle aux patchs d’entrée et applique un masquage stratégique en utilisant l’échantillonnage de Gumbel différentiable. Ce masquage contradictoire force le modèle à reconstruire les signaux physiologiques à partir d’entrées dégradées, favorisant ainsi la robustesse aux occlusions et distractions cliniques. Le processus d’apprentissage suit un curriculum structuré : entraînement initial sur des ensembles de données publics, simulation de motifs d’occlusion observés dans les enregistrements de l’USIP, et adaptation de domaine sur 500 vidéos cliniques non étiquetées. Un module de distillation enseignant-élève léger transfère les a priori physiologiques de modèles experts. Ce pipeline réduit les besoins en données supervisées de 80 %, atteignant une MAE de 3,2 bpm en utilisant seulement 160 patients étiquetés, contre 18,2 bpm avec un entraînement supervisé direct.
Le cadre est validé sur un vaste ensemble de données collectées au CHU Sainte-Justine, démontrant une généralisation à travers les âges, les teintes de peau et les conditions d’occlusion. Le système maintient une MAE inférieure à 7,2 bpm avec plus de 70% d’occlusion faciale, atteignant 3,8 bpm pour les nouveau-nés et 3,5 bpm pour les patients sous ventilation mécanique. Il fonctionne en temps réel dans les contraintes cliniques, consommant 169,7 GFLOPs et 6,1 Go de mémoire avec un débit de 30 FPS. Ensemble, ces contributions lèvent les obstacles clés au déploiement clinique de la rPPG, notamment l’adaptation de domaine, le suivi anatomique et l’efficacité des données, faisant progresser la surveillance physiologique sans contact vers une utilisation pratique en soins intensifs pédiatriques.
| Date | 1 déc. 2025 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Rita Noumeir (Directeur(-trice)) & Philippe Jouvet (Codirecteur(-trice)) |
|---|