Passer à la navigation principale Passer à la recherche Passer au contenu principal

Efficient reinforcement learning using improved prior modeling

Traduction de l'intitulé de la thèse: Apprentissage par renforcement efficace par modélisation améliorée des connaissances a priori
  • Pranav Agarwal

Thèses et mémoires: Thèse de doctoratDoctorat en génie: Génie

Résumé

L’apprentissage par renforcement (RL) s’est imposé comme un cadre unificateur pour la prise de décision séquentielle, mais son impact pratique reste limité par trois contraintes persistantes : une consommation d’échantillons prohibitive, une généralisation médiocre entre tâches et domaines, et un manque d’interprétabilité lié à l’utilisation d’approximateurs de fonctions à grande capacité. Cette recherche soutient que ces limitations partagent une origine commune — une structure a priori insuffisante — et qu’elles peuvent être atténuées en modélisant les agents à l’aide de structures a priori apprenables, discrètes et adaptatives. Nous poursuivons cette hypothèse à travers une trilogie de travaux qui reconfigurent respectivement la récompense, le modèle du monde, et la bibliothèque de compétences sur lesquels repose l’apprentissage efficace. Le premier travail transforme des scores clairsemés fournis par des humains pour la conduite d’engins lourds en une récompense dense et différentiable. En entraînant un prédicteur de scores qui évalue et guide la politique, nous démontrons une exploration sûre dans l’interaction avec l’environnement, comparativement à des heuristiques conçues à la main. Le deuxième travail introduit DART, une architecture basée sur des transformeurs qui tokenise les états, actions et retours dans un alphabet symbolique commun. Ce modèle du monde discret capture des dépendances temporelles de longue portée tout en conservant la manipulabilité des jetons, atteignant une efficacité échantillonnale à la pointe de l’état de l’art sur le benchmark Atari-100k, sans sacrifier les performances finales. Le troisième travail présente STRIDE, un VAE vectoriel quantifié dynamique qui étend de manière autonome un dictionnaire de primitives motrices au fil de l’accumulation des tâches. STRIDE conserve les comportements précédemment appris sans dégradation significative et réduit de moitié le temps d’adaptation sur des curricula de locomotion complexes, tout en fournissant une « trace de compétence » interprétable qui permet aux praticiens d’auditer et de déboguer les décisions. Pris ensemble, ces travaux appuient une hypothèse unificatrice : lorsque les connaissances sur les récompenses, dynamiques et compétences sont exprimées dans des vocabulaires discrets et évolutifs, la recherche tabula rasa cède la place à un apprentissage efficace, compositionnel et transparent. Au-delà des gains empiriques — jusqu’à un facteur 2,6 d’accélération dans divers domaines—ce travail propose des outils conceptuels pour raisonner sur les a priori en RL, fournit des implémentations open-source pour la communauté, et trace des pistes futures vers des structures a priori multimodales et éditables par l’humain. Ce faisant, il marque une avancée décisive vers des systèmes RL dignes de confiance, capables d’apprendre rapidement, de transférer les connaissances et d’expliquer leurs décisions quand cela importe le plus.
Date24 sept. 2025
langue originaleAnglais américain
Établissement diplômant
  • École de technologie supérieure
SuperviseurSheldon Andrews (Directeur(-trice)) & Samira Ebrahimi-Kahou (Codirecteur(-trice))

Mots-clés

  • apprentissage par renforcement efficace
  • modélisation des a priori
  • représentations discrètes
  • apprentissage continu de compétences
  • interprétabilité

Citer cette ressource

'