Les archives numérisées recourent de plus en plus à l’imagerie multispectrale (MS) pour révéler des contenus faibles (encres délavées, palimpsestes, annotations, etc.) et séparer le texte du fond. Or, la décomposition spectrale reste difficile : les approches classiques (e.g., PCA, GMM ou NMF avec rang fixe) exigent des réglages ad hoc, des pré/post-traitements lourds et se généralisent mal à la diversité des supports, des encres et des conditions d’acquisition spectrales.
Pour répondre à ces défis, dans un premier temps, nous introduisons un cadre d’apprentissage bout en bout pour la décomposition multispectrale qui combine un auto-encodeur convolutionnel, couplé à une tête de démélange contrainte (non-négativité, interprétabilité, orthogonalité), enrichie de priors de mise en page (bloc d’attention), afin de préserver la structure des glyphes tout en modélisant le contexte spectro-spatial. Cette approche hybride intègre les principes de la NMF dans une architecture d’auto-encodeur, exploitant ainsi les avantages complémentaires des deux approches. Dans un deuxième temps, face au problème ouvert qu’est le choix manuel du rang, nous proposons un mécanisme pour sa sélection automatique via un élagage (pruning) guidé par longueur de description minimale (MDL), appris conjointement. Les composantes peu informatives sont alors progressivement supprimées pour minimiser simultanément l’erreur de reconstruction et la complexité du modèle. Enfin, dans un troisième temps, nous montrons que ce cadre, nommé PRISM, s’applique aux différentes configurations d’images MS, que ce soit pour les cas sur-déterminés (i.e., plus de bandes que de sources) ou sous-déterminés (i.e., moins de bandes, e.g. RVB), et se généralise au-delà des documents multispectraux.
Évalué sur MSBin et MStex, deux ensembles de documents variés (e.g., lettres, formulaires, manuscrits) de différentes périodes et états, PRISM améliore de manière constante la séparation encre/fond de +29.5 points F-score contre la binarisation de Howe et dépasse ACE v2 de +1.32 points (état-de-l’art). De plus, pour décomposition d’images MS non-supervisée, PRISM reste jusqu’à 7.4× plus rapide que VBONMF, la meilleure approche NMF concurrente. Des tests sur des scènes hyperspectrales de référence, Jasper Ridge et Urban, ainsi que sur des images RVB, confirment une bonne transférabilité au-delà du domaine documentaire. Des études d’ablation valident l’apport du pruning MDL et des différents priors. Ces résultats indiquent qu’associer contraintes physiques et contexte spatial permet des décompositions interprétables et adaptatives, utiles pour la transcription et la restauration. Le code, les poids et les hyperparamètres de PRISM sont disponibles sur Github et accompagnent le mémoire, dont les contributions ont été intégrées dans une publication acceptée au workshop VisionDocs de la conférence ICCV 2025.
| Date | 18 nov. 2025 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohamed Cheriet (Directeur(-trice)) |
|---|