Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
作者:Tianhao Wu, Weizhe Yuan, Olga Golovneva, Jing Xu, Yuandong Tian, Jiantao Jiao, Jason Weston, Sainbayar Sukhbaatar · 年份:2025 · DOI:10.18653/v1/2025.emnlp-main.583 · 被引用次数:8 · 研究领域:Topic Modeling、Computational and Text Analysis Methods、Machine Learning and Data Classification
Tianhao Wu, Weizhe Yuan, Olga Golovneva, Jing Xu, Yuandong Tian, Jiantao Jiao, Jason E Weston, Sainbayar Sukhbaatar. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.