微软研究院把 LLM Judge 变 Coach,优于 rubric RL
MicrosoftResearch · hf · 2026-07-21
核心思路
微软研究院提出 Experiential Learning(EL),想替代开放式任务里只看 rubric 分数的 RL 训练方式。
为什么要改
- 传统的 LLM-as-a-Judge 会把文本反馈压缩成一个标量 reward,丢掉了很多细粒度信息。
- EL 把 judge 改造成 LLM-as-a-Coach:不只是打分,而是把每个 on-policy 输出提炼成可迁移的“经验知识”。
- 这些经验知识会去条件化 teacher model,并通过 on-policy context distillation 被策略吸收。
实验结论
- 相比标量 reward,这种高带宽反馈能提供更密集的监督,也能保留高质量答案之间的细微偏好差别。
- 作者在两类 policy family 上做了实验,反馈来源既包括策略自身,也包括闭源模型;EL 都稳定优于 rubric-based RL。
- 它在训练分布外泛化更好,同时还能缓解 reward hacking。
所属事件:微软提出LLM-as-a-Coach以经验学习优化训练(4 条相关)→
「研究」频道最新
- researchers 辩论双向注意力:检索微调放大后因果性或可舍弃 — antoine_chaffin · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11