微软研究院把 LLM Judge 变 Coach,优于 rubric RL

MicrosoftResearch · hf · 2026-07-21

### 核心思路 微软研究院提出 **Experiential Learning(EL)**,想替代开放式任务里只看 rubric 分数的 RL 训练方式。 ### 为什么要改 - 传统的 LLM-as-a-Judge 会把文本反馈压缩成一个标量 reward,丢掉了很多细粒度信息。 - EL 把 judge 改造成 **LLM-as-a-Coach**:不只是打分,而是把每个 on-policy 输出提炼成可迁移的“经验知识”。 - 这些经验知识会去条件化 teacher model,并通过 on-policy context distillation 被策略吸收。 ### 实验结论 - 相比标量 reward,这种高带宽反馈能提供更密集的监督,也能保留高质量答案之间的细微偏好差别。 - 作者在两类 policy family 上做了实验,反馈来源既包括策略自身,也包括闭源模型;EL 都稳定优于 rubric-based RL。 - 它在训练分布外泛化更好,同时还能缓解 reward hacking。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →