Cette thèse met en place des approches d’apprentissage fiables de représentations d’images de documents qui peuvent relever les défis pratiques du monde réel auxquels est actuellement confronté le domaine de l’analyse d’images de documents. En particulier, deux défis sont relevés: effectuer une analyse efficace sur des ensembles de données à grande échelle et s’adapter à la rareté des données d’apprentissage étiquetées. Les approches proposées visent à améliorer les performances des processus d’analyse d’images de documents lorsqu’elles sont appliquées à des cas d’usages réels. À cette fin, nous abordons les défis pratiques dans deux tâches principales pour l’analyse d’images de documents, la classification et la segmentation sémantique.
Les approches actuelles de représentation de documents se concentrent généralement sur des cas d’usages basés sur l’hypothèse irréaliste selon laquelle toute représentation de documents peut être généralisée lorsqu’elle est appliquée sur des ensembles à grande échelle de données de documents. Par conséquent, nous proposons d’abord une approche de représentation de documents pour la tâche de classification de documents qui peut bien se généraliser pour de tels ensembles de données à grande échelle. Le processus de classification dans cette tâche est basé sur l’existence d’un objet visuel local distinctif (par exemple, une note de bas de page) dans l’image du document, ce qui est très pertinent pour divers cas d’usage dans le domaine de l’analyse d’image de document. L’approche proposée est appliquée à des ensembles de données qui contiennent plus de 32 millions d’images de documents et montre une performance fiable et constante dans divers ensembles de données en utilisant moins de 0,07 % des échantillons de l’ensemble de données pour l’entrainement.
De nombreuses approches récentes d’apprentissage de représentations sont basées sur l’apprentissage supervisé des caractéristiques, ce qui nécessite pour l’entrainement une grande quantité d’images de documents étiquetées pour obtenir des performances fiables. Cependant, dans les cas d’usages réels, la quantité disponible de données étiquetées est très limitée et rare, tandis qu’une grande quantité de données non étiquetées est souvent abondante. Nous proposons donc, pour la tâche de classification des documents, une approche d’apprentissage de représentations de documents capable d’apprendre des caractéristiques uniquement à partir de données non étiquetées, et sans aucune dépendance à des caractéristiques conçues manuellement. Contrairement à notre travail précédent ci-dessus, le processus de classification dans ce travail est basé sur le contexte global de l’image du document. Notre approche utilise des données non étiquetées pour apprendre une représentation qui est utilisée ultérieurement pour la classification de documents, soit avec peu de données étiquetées, soit sans données étiquetées. L’efficacité de l’approche proposée et l’amélioration des performances qui en découle sont démontrées par les résultats expérimentaux obtenus.
En considérant chaque document précédemment classifié, nous proposons enfin une approche d’apprentissage de représentations de documents pour la tâche de segmentation sémantique du document afin d’obtenir une interprétation supplémentaire du contenu de ce document et de le préparer pour d’autres tâches d’analyse. Cette approche est capable d’apprendre des caractéristiques à partir de données non étiquetées sans nécessiter de données annotées, de techniques heuristiques dépendantes des ensembles de données ou d’informations textuelles. En outre, il s’attaque au défi bien connu des similitudes inter-classes élevées entre les différentes classes sémantiques. Des expériences sur divers ensembles de données publiques démontrent l’efficacité de l’approche que nous proposons en produisant de meilleurs résultats que les approches précédentes.
| Date | 15 déc. 2021 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohamed Cheriet (Directeur(-trice)) |
|---|
- analyse de documents
- apprentissage de représentations d’images de documents
- classification de documents
- segmentation sémantique de documents
Abuelwafa, S. (Auteur(e)),
Cheriet (Directeur(-trice)),
15 déc. 2021Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie