Passer à la navigation principale Passer à la recherche Passer au contenu principal

Source rate control in videoconferencing application using state–action–reward–state–action temporal difference reinforcement learning

Traduction de l'intitulé de la thèse: Contrôle de débit de source en visioconférence utilisant l’apprentissage par renforcement état-action-récompense-état-action à différence temporelle
  • Ali Rezagholizadeh

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie des technologies de l'information

Résumé

La proportion de la vidéo IP sur Internet a dépassé 80% et continue d’augmenter. Par conséquent, il est crucial pour les fournisseurs de services vidéo de fournir une excellente qualité vidéo aux utilisateurs finaux. De plus, Internet présente certaines caractéristiques telles que des composants hétérogènes et divers algorithmes de gestion du trafic qui ne garantissent aucune qualité de service. Ainsi, il est de la responsabilité de l’application de contrôler son débit de manière à répondre aux attentes des utilisateurs. Plusieurs travaux ont proposé des algorithmes d’ajustement du débit d’envoi à partir du contrôle du débit source pour contrôler la taille des paquets dans le but de fournir une bonne qualité de service (QoS) ou qualité d’expérience (QoE). Quelques travaux sont appliqués et évalués dans le cadre de la transmission multimédia interactive en temps réel, c’est-à-dire pour la communication en temps réel. Ces algorithmes peuvent être classés en règles de contrôle artisanales et en contrôle automatique. Les méthodes basées sur des règles ont montré un manque de généralisation à d’autres types de réseaux motivant l’étude des méthodes automatiques. Les algorithmes de contrôle automatique existants appliqués dans les applications multimédias interactives en temps réel, telles que la visioconférence, sont basés sur l’apprentissage par renforcement (RL). Dans ce travail, nous proposons une méthode RL tabulaire, c’est-à-dire, sur la politique État-Action-Récompense-État-Action (SARSA) en tant que méthode de différence temporelle en une étape, pour contrôler le débit source, tandis que les autres méthodes basée sur RL fonctionnant pour la communication en temps réel basée sur UDP, appliquent l’approximation de fonction (FA) comme moyen d’apprentissage du modèle. Bien que les approches RL tabulaires consomment plus d’espace mémoire pour stocker leurs paramètres, la mise à jour des paramètres n’est pas approchée comme ce qui est fait dans FA et cela peut conduire à une convergence plus rapide vers une valeur optimale. De plus, les quelques méthodes RL existantes dans un environnement de communication en temps réel formulent des récompenses en utilisant des métriques de QoS objectives qui ne peuvent qu’estimer la QoE qu’un utilisateur expérimente. Au meilleur de nos connaissances, nous présentons la première méthode RL tabulaire pour l’ajustement de débit pour la transmission multimédia interactive en temps réel. Nous proposons également une nouvelle perspective dans la formulation du problème de contrôle de débit en RL. Nous utilisons le PSNR, une métrique de qualité visuelle avec référence largement utilisée, pour évaluer la qualité vidéo perçue par l’utilisateur. Dans ce travail, après avoir suggéré une manière d’appliquer et d’évaluer notre méthode dans un environnement réseau générique, nous proposons un simulateur de réseau basé sur un modèle de file d’attente classique pour nos expériences. Nous appliquons et évaluons la méthode proposée dans le contexte de la visioconférence en utilisant un codec vidéo H.264 sur l’environnement réseau simulé. Notre méthode proposée est évaluée et comparée au réseau neuronal borné (BNN) sur deux configurations du simulateur de réseau, c’est-à-dire avec un débit binaire disponible faible et élevé. Les résultats montrent que SARSA surpasse BNN avec un PSNR, une perte de paquets et une consommation de débit significativement meilleurs.
Date27 avr. 2022
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurStéphane Coulombe (Directeur(-trice)) & Ghyslain Gagnon (Codirecteur(-trice))

Mots-clés

  • contrôle du débit source
  • codage adaptatif du débit
  • visioconférence
  • communication en temps réel
  • apprentissage par renforcement

Citer cette ressource

'