Le réseau sans fil de cinquième génération (5G) fournit des connexions à haut débit, à très faible latence et à haute fiabilité qui peuvent répondre aux exigences de l’Internet industriel des objets (IIoT) dans l’automatisation industrielle, en particulier pour le contrôle robotique. Dans l’entreposage intelligent, la robotique joue un rôle indispensable dans la réalisation de solutions logistiques intelligentes qui comprennent l’organisation, la planification, le contrôle et l’exécution intelligente du flux de marchandises/articles dans l’entrepôt. Les progrès récents des communications sans fil et des technologies de batterie permettent de remplacer de plusieurs travailleurs humains par des systèmes robotiques afin de réduire les coûts de maind’œuvre, d’améliorer l’efficacité du travail en entrepôt et d’augmenter la fiabilité. Cependant, le déploiement de la robotique en essaim impose de nouveaux défis en termes de contrôle pour coordonner de nombreux types de ressources dans l’entrepôt afin de livrer les de services 5G pour la robotique et de planifier des tâches pour les robots.
En particulier, gestion efficace des ressources sans fil dans un réseau 5G hautement dynamique comme dans un entrepôt automatisé est un problème hautement difficile car l’extrême fiabilité et la faible latence avec une grande mobilité des robots ne sont pas résolvables efficacement par l’approche d’optimisation traditionnelle.
À cette fin, dans cette thèse, nous abordons conjointement les deux défis principaux d’un entrepôt automatisé : i)le provisionnement des services 5G et ii) le contrôle de la robotique en essaim. Les contributions principales de cette thèse sont les suivantes :
1. Tout d’abord, nous formulons le problème de provisionnement de services 5G pour servir la robotique en essaim dans l’entrepôt automatisé comme un clustering des multi-point coordonnés (CoMP) conjoints variables dans le temps et une formation de faisceaux de communication ultra-fiable à faible latence (URLLC) 5G. Les approches d’optimisation itératives traditionnelles ne sont pas efficaces pour résoudre ce problème non-convexe en temps réel à cause de leur temps de calcul élevé. Nous proposons ainsi un algorithme de clustering CoMP en utilisant la théorie des jeux combinée à la méthode d’apprentissage automatique Proximal Policy Optimization pour obtenir une solution stationnaire approximative à la solution optimale globale.
2. Deuxièmement, nous étudions le problème du contrôle des systèmes robotiques hétérogènes autonomes en essaim. Nous formulons un problème d’optimisation de contrôle de file d’attente non convexe à long terme pour minimiser la longueur de la file d’attente des tâches à traiter dans l’entrepôt. Les solutions traditionnelles basées sur des approches d’optimisation sont inefficaces pour gérer la nature stochastique du flux de marchandises/tâches et un grand nombre de robots dans le système. Ainsi, nous proposons un algorithme de planification de tâches basé sur l’apprentissage par renforcement profond (DRL) qui utilise la méthode d’optimisation de politique proximale (PPO) pour trouver une politique de planification de tâches optimale. En raison de l’hétérogénéité du système, nous proposons un algorithme basé sur l’apprentissage fédéré pondéré proximal pour implémenter l’algorithme PPO décentralisé qui améliore la performance des agents PPO distribués qui sont déployés dans les différents entrepôts géographiquement distribués. Les résultats de notre démontrent l’efficacité de notre algorithme proposé par rapport aux méthodes existantes.
3. Enfin, nous proposons un modèle pour provisionner des services 5G et controller simultanéement la robotique en essaim dans un entrepôt automatisé. Nous visons à maximiser l’efficacité énergétique à long terme tout en respectant la contrainte de consommation d’énergie des robots et les exigences de communication ultra-fiable et à faible latence (URLLC) entre le contrôleur central et la robotique en essaim. Ce modèle d’optimisation est non-convexe puisque le taux réalisable et la probabilité d’erreur de décodage avec une courte longueur de bloc ne sont ni convexes ni concaves. Nous proposons une approche basée sur l’apprentissage par renforcement profond qui utilise la méthode du gradient de politique déterministe profond (DDPG) et le réseau neuronal convolutif (CNN) pour obtenir une politique de contrôle stationnaire optimale qui consiste en un certain nombre d’actions continues et discrètes. Les résultats expérimentaux montrent que notre algorithme DDPG multi-agent proposé surpasse les solutions existantes dans l’état de l’art en termes de probabilité d’erreur et d’efficacité énergétique.
| Date | 20 juil. 2023 |
|---|
| langue originale | Français |
|---|
| Établissement diplômant | - École de technologie supérieure
|
|---|
| Superviseur | Mohamed Cheriet (Directeur(-trice)) & Kim Khoa Nguyen (Codirecteur(-trice)) |
|---|
- provisionnement de services 5G
- contrôle robotique
- robotique en essaim
- théorie de l’optimisation
- apprentissage par renforcement profond
- apprentissage fédéré
Ho, M. T. (Auteur(e)),
Cheriet (Directeur(-trice)) &
Nguyen (Codirecteur(-trice)),
20 juil. 2023Thèses et mémoires: Thèse de doctorat › Doctorat en génie: Génie