微软研究院把 LLM Judge 变 Coach,优于 rubric RL
MicrosoftResearch · hf · 2026-07-21
### 核心思路 微软研究院提出 **Experiential Learning(EL)**,想替代开放式任务里只看 rubric 分数的 RL 训练方式。 ### 为什么要改 - 传统的 LLM-as-a-Judge 会把文本反馈压缩成一个标量 reward,丢掉了很多细粒度信息。 - EL 把 judge 改造成 **LLM-as-a-Coach**:不只是打分,而是把每个 on-policy 输出提炼成可迁移的“经验知识”。 - 这些经验知识会去条件化 teacher model,并通过 on-policy context distillation 被策略吸收。 ### 实验结论 - 相比标量 reward,这种高带宽反馈能提供更密集的监督,也能保留高质量答案之间的细微偏好差别。 - 作者在两类 policy family 上做了实验,反馈来源既包括策略自身,也包括闭源模型;EL 都稳定优于 rubric-based RL。 - 它在训练分布外泛化更好,同时还能缓解 reward hacking。
「研究」频道最新
- LTX 2.3 LoRA 演示可直接改视频镜头角度 — CQDSN · 2026-07-21
- OpenForecaster 用每日新闻提升语言模型预测能力 — Cohere_Labs · 2026-07-21
- 商汤在 WAIC 2026 推出 U1 Pro 并开源 5000 万样本视觉数据集 — 机器之心 · 2026-07-21
- Baseten 研究发现,LLM 新事实写入权重后很脆弱 — alex_verem · 2026-07-21
- Kimi K3 与 Fable 5 的差距已不像过去那样明显 — FinanceYF5 · 2026-07-21
- uv-scripts/ocr重回HF热门榜并新增JSON模型选择目录 — vanstriendaniel · 2026-07-21