Le nombre de documents numériques a connu une forte augmentation au cours de la dernière décennie, et ce dans différents secteurs, que ce soit industriel, médical, académique et bien d’autres. Bon nombre de ces documents proviennent de numérisations (images de documents), permettant de construire des banques de données partagées au sein d’entreprises, institutions ou même sur internet. Ces grandes bases de données peuvent directement contenir les documents numérisés ou encore être tabulaires, contenant les informations provenant de ces derniers. Cependant, l’extraction manuelle d’informations contenues sur des documents numérisés est chronophage dans un contexte où le nombre de ces derniers ne cesse d’augmenter. Ainsi, automatiser l’extraction d’informations à grande échelle devient un besoin vital, comme par exemple dans des secteurs industriels où le temps est une ressource précieuse. Cette automatisation exige cependant des systèmes rapides, précis et peu coûteux afin qu’ils puissent être efficaces sur de grandes bases de documents.
L’avènement des grands modèles de langues (LLM) a montré de bonnes performances pour l’extraction d’information sur les tâches de réponse à des questions sur des données de texte (QA). Cependant, les images de documents sont des données variées, comportant différents types d’entités (photo, tableau, texte manuscrit, etc.) et pouvant avoir différentes structures (lettre, articles, etc.). Ainsi, elles sont différentes des données que les LLM prennent en entrée, et ne sont donc pas directement utilisables par ces derniers. Par conséquent, la tâche de réponse à des questions sur des images de documents (DocVQA) nécessite de représenter les images de documents afin que les modèles de langues puissent les utiliser afin de répondre à des questions. Dans ce contexte, les approches fondées sur des outils de reconnaissance de caractères optiques (OCR) nécessitent un entraînement supplémentaire, ajoutent de la complexité au système (détection, reconnaissance) et peuvent conduire à des erreurs de transcription. À l’inverse, les méthodes bout-en-bout (OCR-free), composées d’un encodeur visuel et d’un modèle de langue, bénéficient d’une architecture unifiée permettant à la fois de représenter le document et de répondre à la question. Ce type de méthodes regroupe des modèles de petite taille, peu coûteux en termes de calcul, mais limités en qualité de réponses, ainsi que des modèles à grande échelle (LVLM), performants en termes de résultats mais trop lourds pour des déploiements industriels.
Ce mémoire présente ainsi un système DocVQA OCR-free qui apprend un espace de représentation multimodal (image-texte), composé d’un encodeur visuel hiérarchique de petite taille, d’un projecteur multimodal et d’un modèle de langue à grande échelle. L’encodeur visuel transforme l’image de document en jetons (token) projetés sur l’espace du modèle de langue via le projecteur multimodal. Cet encodeur intègre également un encodage positionnel explicite de la mise en page, préservant l’ordre de lecture et la structure des éléments (tableaux, graphiques, zones textuelles) dans l’espace commun. Le décodeur linguistique à grande échelle met directement ces représentations alignées en relation avec la question afin de générer la réponse sans outils additionnels tels que l’OCR. Ce système a été construit en distillant l’encodeur visuel de fondation d’un LVLM dans une architecture hiérarchique plus petite tout en gardant le LLM décodeur afin de réduire le coût de calcul tout en conservant des résultats proches du modèle initial. Afin d’assurer l’alignement image-texte de la représentation, l’encodeur distillé a été supervisé de bout-en-bout avec le LLM décodeur. Suite à cela, un module d’encodage spatial décomposant la position de chaque token en caractéristiques de Fourier a été ajouté afin d’enrichir les jetons par leur position d’origine sur le document. Ces approches ont été évaluées expérimentalement sur le jeu de données DocVQA, contenant des images de documents industriels de différents types (formulaires, lettres, articles, etc.). En utilisant le LVLM Paligemma qui a une performance de 84.77% ANLS, la distillation vers une architecture hiérarchique plus petite a permis de réduire la taille de son encodeur visuel par un facteur de 5, divisant de moitié sa latence (896ms → 446ms) tout en conduisant à un gap de seulement 2.1 points d’ANLS avec une performance de 82.67% ANLS. De plus, l’ajout de l’encodage positionnel a permis d’améliorer les résultats sur la qualité d’extraction des informations du document, réduisant ce gap à 1.31 points avec une performance de 83.46% ANLS. Ainsi, le système proposé surpasse en termes de performance les modèles OCR-free de petites tailles tels que Donut qui a une performance de 66.26% ANLS, et reste compétitif avec les LVLM tels que Paligemma ainsi qu’avec les méthodes se basant sur l’OCR telles que UDOP (84.70% d’ANLS).
Des analyses complémentaires sur la classification (RVL-CDIP) et l’analyse de structure (DocLayNet) montrent que l’encodeur capture la structure globale, tandis que le LLM traite cette dernière de manière plus approfondie à un niveau sémantique.
Enfin, le modèle a été adapté aux documents multi-pages via un sélecteur de page réutilisant les premières couches du LLM, sans paramètres supplémentaires. Cette approche limite le coût de calcul en maintenant le modèle à 2.6B paramètres tout en atteignant 71.73% ANLS, concurrençant les autres modèles de l’état de l’art tels que ScreenAI (72.9% ANLS/5B) ou encore DocOwl2 (69.42% ANLS/8B), démontrant une mise à l’échelle efficace pour des scénarios industriels complexes.
En résumé, ce mémoire démontre qu’un alignement image-texte guidé par une méthode OCRfree intégrant la géométrie spatiale permet de représenter des documents de structures variées contenant différents types d’entités. De plus, il souligne qu’une architecture hierarchique permet de réduire la complexité du système tout en maintenant une qualité de réponse compétitive. Enfin, l’adaptation du modèle aux documents multi-page sans paramètres supplémentaires montre l’extension du système à des cas d’utilisation plus complexes. Cette approche présente donc un DocVQA plus efficient et compétitif pour l’automatisation de l’extraction d’information.
| Date | 24 nov. 2025 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohamed Cheriet (Directeur(-trice)) |
|---|