Passer à la navigation principale Passer à la recherche Passer au contenu principal

Representation learning for document image analysis with practical considerations

Traduction de l'intitulé de la thèse: Apprentissage de représentations basé sur des considérations pratiques pour l’analyse d’images de documents
  • Sherif Abuelwafa

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Cette thèse met en place des approches d’apprentissage fiables de représentations d’images de documents qui peuvent relever les défis pratiques du monde réel auxquels est actuellement confronté le domaine de l’analyse d’images de documents. En particulier, deux défis sont relevés: effectuer une analyse efficace sur des ensembles de données à grande échelle et s’adapter à la rareté des données d’apprentissage étiquetées. Les approches proposées visent à améliorer les performances des processus d’analyse d’images de documents lorsqu’elles sont appliquées à des cas d’usages réels. À cette fin, nous abordons les défis pratiques dans deux tâches principales pour l’analyse d’images de documents, la classification et la segmentation sémantique. Les approches actuelles de représentation de documents se concentrent généralement sur des cas d’usages basés sur l’hypothèse irréaliste selon laquelle toute représentation de documents peut être généralisée lorsqu’elle est appliquée sur des ensembles à grande échelle de données de documents. Par conséquent, nous proposons d’abord une approche de représentation de documents pour la tâche de classification de documents qui peut bien se généraliser pour de tels ensembles de données à grande échelle. Le processus de classification dans cette tâche est basé sur l’existence d’un objet visuel local distinctif (par exemple, une note de bas de page) dans l’image du document, ce qui est très pertinent pour divers cas d’usage dans le domaine de l’analyse d’image de document. L’approche proposée est appliquée à des ensembles de données qui contiennent plus de 32 millions d’images de documents et montre une performance fiable et constante dans divers ensembles de données en utilisant moins de 0,07 % des échantillons de l’ensemble de données pour l’entrainement. De nombreuses approches récentes d’apprentissage de représentations sont basées sur l’apprentissage supervisé des caractéristiques, ce qui nécessite pour l’entrainement une grande quantité d’images de documents étiquetées pour obtenir des performances fiables. Cependant, dans les cas d’usages réels, la quantité disponible de données étiquetées est très limitée et rare, tandis qu’une grande quantité de données non étiquetées est souvent abondante. Nous proposons donc, pour la tâche de classification des documents, une approche d’apprentissage de représentations de documents capable d’apprendre des caractéristiques uniquement à partir de données non étiquetées, et sans aucune dépendance à des caractéristiques conçues manuellement. Contrairement à notre travail précédent ci-dessus, le processus de classification dans ce travail est basé sur le contexte global de l’image du document. Notre approche utilise des données non étiquetées pour apprendre une représentation qui est utilisée ultérieurement pour la classification de documents, soit avec peu de données étiquetées, soit sans données étiquetées. L’efficacité de l’approche proposée et l’amélioration des performances qui en découle sont démontrées par les résultats expérimentaux obtenus. En considérant chaque document précédemment classifié, nous proposons enfin une approche d’apprentissage de représentations de documents pour la tâche de segmentation sémantique du document afin d’obtenir une interprétation supplémentaire du contenu de ce document et de le préparer pour d’autres tâches d’analyse. Cette approche est capable d’apprendre des caractéristiques à partir de données non étiquetées sans nécessiter de données annotées, de techniques heuristiques dépendantes des ensembles de données ou d’informations textuelles. En outre, il s’attaque au défi bien connu des similitudes inter-classes élevées entre les différentes classes sémantiques. Des expériences sur divers ensembles de données publiques démontrent l’efficacité de l’approche que nous proposons en produisant de meilleurs résultats que les approches précédentes.
Date15 déc. 2021
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurMohamed Cheriet (Directeur(-trice))

Mots-clés

  • analyse de documents
  • apprentissage de représentations d’images de documents
  • classification de documents
  • segmentation sémantique de documents

Citer cette ressource

'