Passer à la navigation principale Passer à la recherche Passer au contenu principal

Evaluation of sample efficiency in offline reinforcement learning

Traduction de l'intitulé de la thèse: Évaluation de l’efficacité des données dans l’apprentissage par renforcement hors ligne
  • Shivakanth Sujit

Thèses et mémoires: Mémoire de maîtriseMaîtrise en ingénierie: Génie des technologies de l'information

Résumé

L’apprentissage par renforcement (RL) s’est avéré très prometteur avec des algorithmes apprenant dans des environnements avec de grands espaces d’état et d’action uniquement à partir de signaux de récompense scalaires. L’un des principaux défis des algorithmes actuels d’apprentissage par renforcement est qu’ils nécessitent un nombre considérable d’interactions avec l’environnement pour l’apprentissage. Cela peut s’avérer infaisable dans les situations où ces interactions sont coûteuses, comme en robotique. Les algorithmes RL hors ligne tentent de résoudre ce problème en amorçant le processus d’apprentissage à partir des données enregistrées existantes sans avoir besoin d’interagir avec l’environnement dès le départ. Alors que les algorithmes RL en ligne sont généralement évalués en fonction du nombre d’interactions avec l’environnement, il n’existe pas de protocole unique établi pour évaluer les méthodes RL hors ligne. Dans cette thèse, nous proposons une approche séquentielle pour évaluer les algorithmes RL hors ligne en fonction de la taille de l’ensemble d’apprentissage et donc de leur efficacité en termes de données. L’évaluation séquentielle fournit des informations précieuses sur l’efficacité du processus d’apprentissage et la robustesse des algorithmes aux changements de distribution dans l’ensemble de données, tout en harmonisant la visualisation des phases d’apprentissage en ligne et hors ligne. Notre approche est généralement applicable et facile à mettre en œuvre. Nous comparons plusieurs algorithmes RL hors ligne existants à l’aide de cette approche et présentons les résultats d’une variété de tâches et d’ensembles de données hors ligne.
Date6 déc. 2023
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurSamira Ebrahimi-Kahou (Directeur(-trice))

Mots-clés

  • apprentissage par renforcement hors ligne
  • méthodes d’évaluation

Citer cette ressource

'