La compréhension de l’image documentaire (DIU) a attiré beaucoup d’attention et est devenue l’un des domaines de recherche actifs. Bien que le but ultime de DIU soit d’extraire des informations textuelles d’une image de document, de nombreuses étapes sont impliquées dans un tel processus tel que la catégorisation, la segmentation et l’analyse de mise en page. Toutes ces étapes sont nécessaires pour obtenir un résultat précis à partir de la reconnaissance de caractères ou de la reconnaissance de mots d’une image de document. L’une des étapes importantes dans DIU est la catégorisation d’image de document (DIC) qui est nécessaire dans de nombreuses situations telles que l’image de document multi-script ou multi-polices ou multi-langue. Cette étape fournit des informations utiles pour le système de reconnaissance et aide à réduire son erreur en permettant d’incorporer un système de reconnaissance optique de caractères (OCR) ou un système de reconnaissance de mots (WR) spécifique à une catégorie. Cette recherché se concentre sur le problème de DIC dans différents niveaux de script, de style et de langage et établit un cadre pour la représentation flexible et l’extraction de caractéristiques qui peuvent être adaptées à de nombreux problèmes DIC. Les méthodes actuelles pour DIC ont de nombreuses limitations et inconvénients qui limitent l’utilisation pratique de ces méthodes. Nous proposons des nouvelles méthodes de catégorisation de l’image de document en fonction de la représentation des patches et la «Non-negative Matrix Factorization (NMF)».
De nombreuses méthodes existent pour l’identification par script de l’image du document, mais peu d’entre elles ont abordé le problème dans les manuscrits imprimés et elles ont beaucoup de limites et d’inconvénients. Par conséquent, notre premier objectif est d’introduire une nouvelle méthode pour l’identification des manuscrits anciens. La méthode proposée est basée sur une représentation de patches dans laquelle les patches sont extraits à l’aide de la carte squelette d’une image de document. Cette représentation surmonte la limitation des méthodes actuelles sur le niveau spécifique de mise en page. Le schéma proposé d’extraction de caractéristiques basé sur la «Projective Non-negative Matrix Factorization (PNMF)» est robuste contre les variations de bruit et d’écriture et peut être utilisé pour différents scripts. La méthode propose est plus performante que les méthodes de pointe et peut être appliquée à différents niveaux de mise en page.
Les méthodes actuelles d’identification de police de caractères (ou style d’écriture) sont principalement proposées pour être appliquées sur une image de document imprimée à la machine et beaucoup d’entre elles ne peuvent être utilisées que pour une niveau de mise en page spécifique. Par conséquent, nous proposons une nouvelle méthode pour l’identification de police et de style des manuscrits imprimés et manuscrits basés sur la représentation de patch et «Non-negative Matrix Tri-Factorization (NMTF)». Les images sont représentées par des patches superposés qui ont obtenus à partir des pixels de premier plan. La position de ces patches est définie en fonction de la carte du squelette afin de réduire le nombre de patches. NMTF est utilisée pour apprendre les bases de chaque police de caractères (ou style), puis ces bases sont utilisées pour classer une nouvelle image basée sur de erreur de représentation minimale. La méthode proposée peut facilement être étendue à des nouvelles polices de caractères car les bases de chaque police de caractères sont apprises séparément des autres polices de caractères. Cette méthode est testée sur deux bases de données de manuscrits anciens et imprimés à la machine et les résultats ont confirmé sa performance par rapport aux méthodes de pointe.
Enfin, nous proposons une nouvelle méthode pour l’identification de la langue de document basée sur la représentation de patch et Non-negative Matrix Tri-Factorization (NMTF). Les méthodes d’identification du langage sont basées sur des données textuelles obtenues par le moteur OCR ou des données d’images par codage et comparaison avec des données textuelles. La méthode basée sur le moteur OCR nécessite beaucoup de traitement et la méthode base sur l’image actuelle ne s’applique pas aux scripts cursifs tels que l’Arabe. La representation du patch fournit le composant du script Arabe (lettres) qui ne peut pas être extrait simplement par des méthodes de segmentation. NMTF est utilisé pour l’apprentissage du dictionnaire et la génération de «codebook» qui seront utilisés pour représenter l’image du document avec un histogramme. La méthode proposée est testée sur deux séries de manuscrits ancients et imprimés et comparée aux caractéristiques n-gram obtenues (basées sur le texte) et aux caractéristiques de textures et de codebook (basées sur l’image) pour valider la performance.
Les méthodes proposées sont robustes a la variation des écritures, les changements dans le polices de caractères (ou style d’écriture) et la présence de dégradation. Elles sont aussi flexibles quant aux différents niveaux de mise en page (d’une ligne de texte à un paragraphe). Les méthodes de cette recherche ont été testées sur des ensembles de manuscrits et imprimés à la machine et comparées à des autres méthodes. Toutes les évaluations montrent l’efficacité, la robustesse et la flexibilité des méthodes proposées pour la catégorisation de l’image de document. Comme mentionné précédemment, les stratégies proposées fournissent un cadre pour une représentation efficace et flexible et une extraction de caractéristiques pour la categorization d’images de documents. Ce cadre de travail peut être appliqué à différents niveaux de mise en page, les informations provenant de différents niveaux de mise en page peuvent être fusionnées et mélangées et ce cadre peut être étendu à des situations plus complexes et à des problèmes différents.
| Date | 24 janv. 2018 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohamed Cheriet (Directeur(-trice)) |
|---|
- Traitement d'images Techniques numériques. Reconnaissance des formes (Informatique) Cadres d'applications (Informatique) Conception. Manuscrits Numérisation. Copies (Industries graphiques) Numérisation. Segmentation d'image. Matrices non-négatives. Regroupement des documents (Informatique) Écriture script Identification. Polices (Industries graphiques) Identification. Langage et langues Identification. patch
- représentation
- catégorisation d’image de document
- clustering
- non-negative matrix factorization
- identification de script
- Identification de police de caractères
- Identification de langage de document
Arabnejad, E. (Auteur(e)),
Cheriet (Directeur(-trice)),
24 janv. 2018Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie