Passer à la navigation principale Passer à la recherche Passer au contenu principal

Visual information retrieval from historical document images

Traduction de l'intitulé de la thèse: La recherché d'information visuelle à partir d'images de documents historiques
  • Sara Zhalehpour

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie de la production automatisée

Résumé

Au cours des dernières décennies, la préservation et la publication de documents historiques en format numérique ont fait l’objet d’une attention considérable. Bien que les techniques modernes de numérisation aient pour la plupart résolu le problème de la protection et de l’accès à ces documents, la tâche de la recherche et de l’interprétation de l’information visuelle demeure un problème difficile. Cela est dû aux structures complexes et inhabituelles des documents historiques en plus de leur nature dégradée. Pour la recherche d’informations à partir de documents historiques, une approche appropriée est nécessaire pour caractériser le contenu du document de manière cohérente. Les documents imprimés contiennent non seulement des caractères de texte et leurs formats, mais également des éléments typographiques associés. Trouver et poursuivre les objets typographiques visuels existants qui façonnent le contenu des documents historiques nous aide à récupérer et à transmettre plus d’informations sur les différentes méthodes de représentation de ces documents. Ces éléments peuvent être des notes de bas de page qui font référence aux auteurs et démontrent la relation entre les manuscrits et les sources, ou des tableaux qui résument différentes sortes d’informations dans des forms géométriques. Cette recherche se concentre sur le problème de la détection des notes de bas de page et des tableaux dans les documents historiques et établit un cadre pour chacun des objectifs déterminés. Ces cadres doivent gérer efficacement des structures complexes de documents historiques et posséder en même temps le pouvoir de généralisation pour s’appliquer aux collections d’images de documents à grande échelle. Jusqu’à maintenant, la détection des notes de bas de page a rarement été abordée dans la littérature. Par conséquent, notre première contribution est de présenter un nouveau cadre pour la classification des images de documents basée sur les notes de bas de page dans les documents historiques. L’idée de base derrière ce cadre est d’utiliser les caractéristiques visuelles les plus importantes d’une note de bas de page pour créer un vecteur de caractéristiques. Les trois caractéristiques visuelles les plus importantes d’une note de bas de page sont la taille réduite de la note par rapport au corps du texte, l’emplacement de la note au bas de la page et l’écart relativement plus important entre la note et le corps du texte comparé à l’espace de ligne standard. Trois méthodes sont proposées en fonction de chacune de ces observations. Nous définissons certaines règles à l’aide de ces observations pour créer notre vecteur de caractéristiques. Notre cadre pour la classification des images de documents basée sur les notes de bas de page dans les documents historiques est complété en alimentant par ces vecteurs caractéristiques un classificateur de machine à vecteurs de support (SVM). Le cadre proposé est appliqué à plus de 32 millions d’images du 18 ème siècle. Les résultats de l’évaluation prouvent l’efficacité, la puissance de généralisation et la robustesse de notre cadre présenté pour détecter les pages contenant une note de bas de page malgré leur mise en page et leur type de structure. Les méthodes les plus récentes de détection de tableaux dans les documents utilisent principalement des documents de balisage (par exemple, pdf, HTML, etc.) et ne couvrent pas tous les types de tableaux dans un cadre. Cependant, pour les documents historiques, qui sont notre principale étude dans le cadre de cette thèse, nous avons seulement accès à l’image numérisée et devons traiter tous les types de tableaux en même temps. Le cadre proposé est basé sur l’hypothèse que les textes dans les tableaux se présentent de manière harmonique en colonnes. Ce fait suggère l’idée d’utiliser une méthode spectrale pour développer notre cadre. Nous proposons une approche basée sur l’utilisation de coefficients cepstraux de fréquence de Mel (MFCC) pour classer des images de document selon la présence ou non de tableaux dans la page. Les MFCC sont des procédures bien connues de reconnaissances automatiques de la parole. Ces méthodes mettent l’accent sur la fréquence basses du signal. Un classificateur SVM est utilisé comme dernière étape de notre framework pour détecter les pages contenant des tableaux. Nous testons le cadre introduit sur nos ensembles de données et les résultats confirment l’efficacité de la méthode proposée par rapport à la fois à une méthode reconnue et à notre ensemble de données de référence des documents imprimés du 18ème siècle.
Date10 août 2018
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurMohamed Cheriet (Directeur(-trice))

Mots-clés

  • recherche d’information visuelle
  • document historique image
  • classification des documents
  • détection de note
  • boîtes de délimitation
  • projection horizontale
  • détection de tableaux
  • tableaux de lignes de régnant
  • tableaux de lignes non-régnant
  • MFCC
  • machines à vecteurs de support

Citer cette ressource

'