Passer à la navigation principale Passer à la recherche Passer au contenu principal

Detection of spam review on mobile app stores, evaluation of helpfulness of user reviews and extraction of quality aspects using machine learning techniques

Traduction de l'intitulé de la thèse: Détection, sur les plates-formes de distribution des applications mobiles, des opinions frauduleuses, évaluation de l’utilité des avis des utilisateurs et extraction des aspects qualité en utilisant des techniques d’apprentissage automatique
  • Necmiye Genc

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

Alors que les appareils mobiles ont dépassé l’accès Internet fixe, les applications mobiles et les plates-formes de distribution ont pris de l’importance. Ces plates-forme de distribution permettent aux utilisateurs de rechercher et d’acheter des applications mobiles, puis de donner leurs opinions sous forme d’avis et de notes. Un avis peut contenir des informations critiques sur l’expérience utilisateur, les demandes de fonctionnalités et les rapports de bogues. Les avis des utilisateurs sont précieux non seulement pour les développeurs et les éditeurs de logiciels intéressés à connaître l’opinion de leurs clients, mais également pour les utilisateurs potentiels désireux de savoir ce que les autres pensent de l’application mobile. Bien que certains chercheurs aient répertorié les techniques et méthodes d’analyse d’opinion, aucune étude systématique de la littérature n’a encore fait état de problèmes d’extraction d’opinion et de détection des opinions frauduleuses dans une plate-forme de distribution d’applications mobiles. L’extraction d’opinions nécessite un pré-traitement au niveau du texte et du contenu, y compris le filtrage du contenu sans opinion et l’évaluation de la fiabilité et de l’authenticité des critiques. La prédiction de l’utilité des applications mobiles et les problèmes de détection des opinions frauduleuses n’ont guère retenu l’attention de la littérature universitaire. De plus, la pertinence des fonctionnalités extraites n’a pas fait l’objet d’une validation croisée avec les principaux concepts de génie logiciel. Ce projet de recherche a d’abord fait une revue systématique de la littérature sur l’évaluation des études d’extraction des opinions sur les plates-formes de distribution d’applications mobiles. Pour combler les lacunes identifiées dans cette revue de littérature, nous avons ensuite utilisé un réseau de neurones convolutifs pour apprendre à représenter des documents pour la détection de révisions frauduleuses en caractérisant un jeu de données d’avis d’utilisateurs sur des plates-formes de distribution d’applications mobiles, ce qui inclut des analyses de vérités et de fraudes. Nos résultats ont révélé que notre méthode de détection basée sur un réseau de neurones atteignait une précision de 82,5%, tandis qu’un modèle de classification de type Machine Support Vector Machine (SVM) n’atteint que 70% de précision, malgré l’utilisation de diverses combinaisons de fonctions. Nous avons ensuite comparé quatre modèles de classification afin d’évaluer l’utilité des avis des utilisateurs d’une plate-forme de distribution pour proposer un modèle prédictif reposant sur des méta-données des avis, ainsi que sur des caractéristiques structurelles et lexicales pour la prédiction de l’utilité fonctionnelle de ces avis. Dans la dernière partie de cette étude, nous avons construit un jeu de données annotées des opinions sur des applications mobiles pour la tâche d’extraction d’aspects de qualité, basé sur la norme ISO 25010 - Normes d’évaluation de la qualité des produits et logiciels. Nous avons ensuite utilisé deux modèles de réseau neuronal profond pour l’extraction d’aspects à partir des avis d’utilisateurs: bidirectionnel long-court avec mémoire de termes et champ aléatoire conditionnel (Bi-LSTM + CRF) et réseaux de neurones à structure profonde et champ aléatoire conditionnel (CNN + CRF). Les deux modèles ont obtenu un score F1 de près de 80% (moyenne pondérée de la précision et du rappel, qui prend en compte à la fois les faux positifs et les faux négatifs) avec l’appariement exact d’aspects, et un score F1 de 86% dans l’appariement partiel.
Date4 juin 2019
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurAlain Abran (Directeur(-trice))

Mots-clés

  • ingénierie des exigences
  • apprentissage automatique
  • exploration de textes
  • applications mobiles
  • détection de spam
  • évaluation de l’utilité des revues
  • extraction des aspects qualité

Citer cette ressource

'