Passer à la navigation principale Passer à la recherche Passer au contenu principal

Deep learning-based approach for illustration and diagram detection in large-scale datasets of historical document images

Traduction de l'intitulé de la thèse: Approche fondée sur l’apprentissage profond pour la détection des illustrations et des diagrammes dans des bases de données à large échelle d’images de documents historiques
  • Zohreh Hajabedi

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie

Résumé

Les manuscrits historiques contiennent des informations précieuses sur les cultures et les connaissances de l’être humain dans de nombreux domaines. Ces précieuses ressources doivent être préservées, entretenues et partagées. À cette fin, de nos jours, des référentiels de documents numérisés ont été créés à partir de ces ressources et, par conséquent, de larges volumes d'images de documents numérisés sont maintenant disponibles. Le défi est alors de récupérer des informations à partir des ressources numérisées extrêmement volumineuses. D'autre part, la diversité de la structure et de la mise en page de ces manuscrits anciens, ainsi que la détérioration habituelle des documents historiques, font de l'extraction des informations et de leur analyse une tâche difficile qui est peu susceptible d'être effectuée par des êtres humains. Outre le contenu du texte, les documents historiques contiennent également des objets typographiques tels que des illustrations et des diagrammes qui portent des connaissances visuelles et soutiennent le contenu du document en fournissant une vue abstraite des concepts. Ces objets aident à comprendre le contenu du texte de manière plus productive. L'identification de ces objets typographiques nous renseigne sur la structure des documents. De plus, des informations sur les objets typographiques seraient utiles pour créer un index et des métadonnées pour les grands référentiels de documents numérisés. En raison du récent succès des approches d'apprentissage profond dans les applications de vision par ordinateur, dans cette thèse, une approche basée sur CNN a été utilisée pour détecter les illustrations et les diagrammes et classer les images du document en fonction de la présence de ces objets typographiques. Le modèle proposé a été appliqué à de grandes bases de données d'images de documents historiques d'ECCO et de NAS. Ces deux bases de données contiennent respectivement plus de 32 millions et 500,000 images de documents anciens. À l'instar des autres applications du monde réel, dans nos bases de données cibles, nous avions accès à un nombre limité de données étiquetées pour l'ensemble d'entraînement et de test. De plus, notre base de données d'entraînement est déséquilibrée et il y a une distribution inégale des classes. Pour faire face à ces problèmes et aussi pour atténuer le surapprentissage qui en résulte, nous avons rai forcé notre approche avec des techniques de régularisation et d'augmentation pour améliorer les performances. Le modèle final a obtenu des résultats prometteurs sur les grands ensembles de données ECCO et NAS.
Date18 août 2021
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurMohamed Cheriet (Directeur(-trice))

Mots-clés

  • analyse d'image de document
  • images de documents historiques
  • détection d'illustration
  • détection de diagramme
  • classification d'image de document
  • deep learning
  • Jeu de données déséquilibré
  • augmentation

Citer cette ressource

'