Autrefois isolé par les frontières géographiques, les communautés criminelles profitent de l’anonymat fourni par certains réseaux, tel le réseau TOR, faisant partie de l’Internet clandestin (Dark Web), afin de coopérer, vendre et partager leurs connaissances. Pour une organisation, analyser ces échanges sur les multiples forums présents sur ce réseau permet de détecter les tendances et ainsi prévenir de futures attaques. Par conséquent, ce mémoire propose une nouvelle approche afin de généraliser l’extraction des sujets de discussions et ses attributs (titre, auteur et date de publication). Celle-ci est portée par l’hypothèse qu’il est possible d’utiliser des outils provenant du traitement automatique des langues naturelles (TALN) afin de procéder à l’extraction de contenu sur le Web.
Afin de procéder à l’extraction des sujets de discussions, deux sous-objectif sont poursuivis. Le premier consiste à utiliser des outils d’annotation de séquences afin d’identifier les enregistrements et leurs attributs dans une page Web. Le deuxième est de procéder à l’extraction du contenu identifié. Pour y parvenir, une méthode est définie afin de transformer une page Web en une séquence composée de balises HTML et de texte. Il est alors possible de procéder à l’annotation de séquences sur celle-ci avec un modèle BiLSTM-CRF. La séquence est ensuite reconstruite en pageWeb afin de procéder à l’extraction des sujets de discussions. Pour ce faire, des algorithmes d’extraction ont été conçus, tirant avantage de la structure en graphe des pages HTML.
Suite aux expériences menées, qui consistaient à déterminer les meilleurs hyperparamètres et tailles de vocabulaire pour le modèle, il est possible de confirmer l’hypothèse de ce mémoire. En effet, les bons résultats sur le jeu de de tests de l’ensemble A (macro F1 de 99,5%), ainsi que les performances en contexte industriel, démontrent que la solution développée a su généraliser la structure des forums. Par conséquent, il est possible d’extraire des sujets de discussions sur de nouveaux forums qui n’ont pas été utilisés lors du processus d’entraînement du modèle.
| Date | 24 mars 2022 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Sylvie Ratté (Directeur(-trice)) & Pierre André Ménard (Codirecteur(-trice)) |
|---|
- moissonnage du Web
- traitements automatique des langues naturelles
- annotation de séquences
- forums clandestins
Michaud, O. (Auteur(e)),
Ratté (Directeur(-trice)) & Ménard (Codirecteur(-trice)),
24 mars 2022Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie