Multi-turn Reinforcement Learning with Preference Human Feedback
作者:Lior Shani, Aviv Rosenberg, Asaf Cassel, Oran Lang, Daniele Calandriello, Avital Zipori, Hila Noga, Orgad Keller, Bilal Piot, Idan Szpektor, Avinatan Hassidim, Yossi Matias, Rémi Munos · 年份:2024 · DOI:10.52202/079017-3779 · 被引用次数:2 · 研究领域:Reinforcement Learning in Robotics、Motor Control and Adaptation、Robot Manipulation and Learning