L’afflux croissant de personnes vivant dans les mégapoles exige une approche intelligente pour créer une infrastructure durable dans les zones urbaines et fournir des services plus efficaces. Les bâtiments qui ouvrent automatiquement les portes d’entrée, les lumières s’allument, les systèmes de chauffage et de refroidissement s’adaptant d’eux-mêmes, les caméras surveillant le trafic, entre autres situations, sont des exemples d’innombrables réseaux de capteurs interagissant avec les espaces et les personnes. Ces capteurs et systèmes envoient un volume énorme de données dans la plate-forme logicielle des centaines de fois par minute, exigeant une vitesse élevée dans le traitement et le stockage de ces informations via le réseau, l’Internet des objets. Ce comportement numérique fonde le concept de ville intelligente. Si la variété, le volume et la vitesse des données sont la définition du Big Data, les deux sont ancrés dans le développement des technologies de l’information et de la communication.
Cependant, les données disponibles sont distribuées et agrégées collectivement et leur fusion pourrait révéler des tendances qui ne seraient pas possibles si les données étaient analysées séparément. L’hypothèse principale de l’examen de la fusion de données est que la vue d’ensemble des informations fusionnées permet d’optimiser le flux d’électricité à travers le réseau électrique, de soutenir le déplacement des réseaux de transport, de veiller à la santé et à la sécurité des personnes, et bien plus encore. Pourtant, selon la revue de la littérature, il existe deux problèmes majeurs liés aux données de fusion. Premièrement, dans un scénario réel, tout système (par exemple, une application et une plate-forme) est soumis à la production de données qui pourraient être imprécises, insuffisantes, dupliquées, incorrectes, incohérentes, ambiguës, en plus des valeurs manquantes. Deuxièmement, dans la plupart des cas, les solutions de fusion se concentrent sur une stratégie minière prédéfinie et des tâches supervisées.
Pour s’affranchir du premier problème, il est à noter que les valeurs manquantes peuvent affecter considérablement le résultat des analyses et de la prise de décision dans n’importe quel domaine et que les deux principales approches pour traiter ce problème sont des méthodes statistiques et basées sur des modèles. Alors que la première apporte un biais aux analyses, la seconde est généralement conçue pour des cas spécifiques. Pour faire face aux limites des deux méthodes, nous présentons un cadre d’ensemble empilé basé sur l’intégration de l’algorithme de forêt aléatoire adaptative, de l’indice de Jaccard et de la probabilité bayésienne. Compte tenu du défi que représentent les données hétérogènes et distribuées provenant de sources multiples, nous avons construit un modèle d’utilisation qui prend en charge différents types de données: continues, discrètes, catégorielles et binaires.
Dans le but de surmonter la deuxième limitation de la fusion de données, nous introduisons un modèle d’apprentissage d’ensemble de fusion pour des ensembles de données multiples et hétérogènes empilant la machine Boltzmann restreinte, qui rassemblent les caractéristiques latentes des ensembles de données non étiquetés et l’algorithme de tri-factorisation matricielle pour fusionner les caractéristiques dans une structure de matrice de blocs. En combinant ces techniques, nous avons pu concevoir un outil efficace de découverte de connaissances. L’évaluation des deux solutions proposées tient compte de l’imputation des valeurs manquantes, et les données de fusion ont montré que notre modèle d’apprentissage d’ensemble produit des résultats prometteur et compétitifs, surmontant les limites précédemment décriteo dans la revue de la littérature.
| Date | 12 févr. 2021 |
|---|
| langue originale | Anglais américain |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohamed Cheriet (Directeur(-trice)) |
|---|
- big data
- fusion de données
- apprentissage en profondeur
- apprentissage d’ensemble
- ville intelligente
- imputation de données manquantes
- données distribuées
- multi domaines
Costa Carvalho, A. L. (Auteur(e)),
Cheriet (Directeur(-trice)),
12 févr. 2021Thèses et mémoires: Mémoire de maîtrise › Maîtrise en ingénierie: Génie des technologies de l'information