Cette thèse présente un cadriciel pour la découverte, l’extraction et le réordonnancement des concepts pertinents d’un domaine d’affaires dans le contexte de leur réutilisation au sein d’un projet logiciel. L’objectif est de soutenir les experts en ingénierie logicielle lors de la première phase d’acquisition de connaissances d’un projet de développement en identifiant automatiquement les concepts pertinents à partir des documents textuels de l’organisation cliente. Ce type de tâche est typiquement fastidieux et sensible à la fatigue cognitive, aux erreurs d’inattention ainsi qu’aux omissions. Les documents d’affaires d’une entreprise sont considérés comme étant non structurés et sont moins formels et concis que les documents de spécification logiciel crées par un expert en logiciel. Par ailleurs, le corpus utilisé est composé de documents rédigés en français, langue pour laquelle les outils linguistiques sont moins nombreux et moins performants que pour l’anglais. Le système présenté a donc comme objectif d’intégrer des outils accessibles dans une suite de traitements visant à améliorer cette extraction.
La première contribution est une définition d’une suite de traitements visant la découverte rapide de concepts pertinents pour un ingénieur logiciel en démarrage de projet. Pour éviter les concepts non pertinents résultant de l’utilisation d’outils d’analyse textuels complexes, le processus est composé majoritairement de filtres positifs et négatifs qui sont typiquement plus robustes et stables. Les concepts candidats ainsi extraits sont ordonnés en utilisant un algorithme de propagation de poids basé sur les indices structurels des documents sources. Lorsqu’appliqué sur un corpus de textes provenant d’organisations publiques, ce processus a produit des résultats 2,7 fois meilleurs que la méthode statistique de comparaison appliquée sur l’ensemble du corpus. Nous présentons une nouvelle mesure pour évaluer la performance de la vitesse de découverte de nouveaux concepts pour des systèmes de même nature. Finalement, nous présentons l’effort d’annotation qui a permis de produire un corpus de référence pour évaluer la performance de systèmes d’extraction de connaissance visant les projets de génie logiciel.
La deuxième contribution est une méthode statistique d’extraction des expressions multimots longues et complexes qui se retrouvent dans les documents d’affaires. Ces concepts, parfois considérés comme des entités nommées ou des expressions standards, sont essentiels à la compréhension complète d’un corpus de document d’affaires mais sont souvent ignorés par les méthodes d’extraction existantes à cause de leur forme, leur faible occurrence et le fait qu’ils sont habituellement mis de côté par l’étape de génération d’expressions candidates. Les méthodes courantes offrent donc des performances très faibles sur ces expressions de grande taille. L’approche présentée se base sur une technique de maximum local utilisant des données linguistiques pour aider le filtrage et l’analyse de fréquences. Elle utilise des règles souples de génération de candidats très longs qui sont alors filtrés dans des semi-lattices construites à l’aide des n-grammes constitués des lemmes racines des expressions. Le choix des expressions pertinentes est basé sur un facteur statistique de croissance des n-grammes. Deux corpus annotés sont utilisés pour produire une base de comparaison des performances. Les résultats indiquent une augmentation de 23,4% de la f-mesure pour un corpus de taille moyenne (150 documents) et de 22,2% sur un corpus de petite taille (5 documents).
La contribution finale vise à augmenter les performances de la détection d’acronymes qui fournit une couche additionnelle pour le filtrage des concepts. Ce travail vise l’extraction des acronymes implicitement présentés dans les documents d’affaires qui sont rarement la cible d’effort de recherche contrairement à ceux de d’autres acronymes comme ceux du domaine biomédical. Bien que ce soit des défis similaires, la nature semi-structurée et imprévisible des documents d’affaires est un problème supplémentaire qui réduit l’efficacité des outils développés pour le domaine biomédical, qui offrent des performances inadéquates lorsqu’appliqués sur le type de document utilisés dans cette recherche. La forme explicite et implicite d’acronymes est identifiée en utilisant des indices textuels et syntaxiques. Parmi sept attributs extraits pour chaque candidat à l’étude, nous introduisons des attributs de “similarité” qui comparent le probabilité d’un candidat à être considéré comme une forme longue d’acronyme d’une forme courte spécifique. Cette évaluation est basée sur une comparaison des valeurs du candidat et celles générées à partir d’un ensemble de référence validé manuellement. Un score est établi pour les règles communément utilisées pour évaluer les candidats (première lettres correspondantes, instances ordonnées, etc.) et sont agrégés dans un attribut unique qui permet une classification plus flexible. Cent trente-cinq documents d’affaires rédigés en français provenant de 14 organisations différentes ont été utilisés pour l’entrainement et l’évaluation de cette méthode, offrant un rappel de 90,9% et un niveau de précision de 89,1% pour un espace de recherche de trois phrases.
| Date | 23 oct. 2014 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Sylvie Ratté (Directeur(-trice)) |
|---|
- Exploration de données (Informatique) Linguistique informatique. Documents administratifs. Logiciels Développement. acronyme
- concept
- expression
- extraction
- ingénierie logicielle
- recherche d’information
- forage de texte
- modèle de domaine
- identification d’expression
- complexe multimots
Ménard, P. A. (Auteur(e)),
Ratté (Directeur(-trice)),
23 oct. 2014Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie