Les manuscrits historiques contiennent des informations précieuses sur les cultures et les connaissances de l’être humain dans de nombreux domaines. Ces précieuses ressources doivent être préservées, entretenues et partagées. À cette fin, de nos jours, des référentiels de documents numérisés ont été créés à partir de ces ressources et, par conséquent, de larges volumes d'images de documents numérisés sont maintenant disponibles. Le défi est alors de récupérer des informations à partir des ressources numérisées extrêmement volumineuses. D'autre part, la diversité de la structure et de la mise en page de ces manuscrits anciens, ainsi que la détérioration habituelle des documents historiques, font de l'extraction des informations et de leur analyse une tâche difficile qui est peu susceptible d'être effectuée par des êtres humains.
Outre le contenu du texte, les documents historiques contiennent également des objets typographiques tels que des illustrations et des diagrammes qui portent des connaissances visuelles et soutiennent le contenu du document en fournissant une vue abstraite des concepts. Ces objets aident à comprendre le contenu du texte de manière plus productive. L'identification de ces objets typographiques nous renseigne sur la structure des documents. De plus, des informations sur les objets typographiques seraient utiles pour créer un index et des métadonnées pour les grands référentiels de documents numérisés.
En raison du récent succès des approches d'apprentissage profond dans les applications de vision par ordinateur, dans cette thèse, une approche basée sur CNN a été utilisée pour détecter les illustrations et les diagrammes et classer les images du document en fonction de la présence de ces objets typographiques. Le modèle proposé a été appliqué à de grandes bases de données d'images de documents historiques d'ECCO et de NAS. Ces deux bases de données contiennent respectivement plus de 32 millions et 500,000 images de documents anciens.
À l'instar des autres applications du monde réel, dans nos bases de données cibles, nous avions accès à un nombre limité de données étiquetées pour l'ensemble d'entraînement et de test. De plus, notre base de données d'entraînement est déséquilibrée et il y a une distribution inégale des classes. Pour faire face à ces problèmes et aussi pour atténuer le surapprentissage qui en résulte, nous avons rai forcé notre approche avec des techniques de régularisation et d'augmentation pour améliorer les performances. Le modèle final a obtenu des résultats prometteurs sur les grands ensembles de données ECCO et NAS.
| Date | 18 août 2021 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohamed Cheriet (Directeur(-trice)) |
|---|
- analyse d'image de document
- images de documents historiques
- détection d'illustration
- détection de diagramme
- classification d'image de document
- deep learning
- Jeu de données déséquilibré
- augmentation
Hajabedi, Z. (Auteur(e)),
Cheriet (Directeur(-trice)),
18 août 2021Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie