微软研究提出 LLM-as-a-Coach 训练不可验证任务
donglixp · x · 2026-07-22
微软研究提出了 LLM-as-a-Coach,试图解决不可验证任务上的训练信号稀疏问题。
- 论文认为,传统 RL 把开放式任务的丰富评估压缩成一个标量奖励,会丢掉很多细粒度反馈。
- 作者提出 Experiential Learning(EL):把原本用于 LLM-as-a-Judge 的反馈模型改造成 LLM-as-a-Coach,将对每个回答的评价转成可迁移的“经验知识”。
- 这些经验知识再用于条件化教师模型,并通过 on-policy context distillation 被策略模型吸收。
- 论文声称,相比基于 rubric 的 RL,EL 能提供更密集的监督、保留高质量回答之间的细微偏好、在分布外泛化更好,并且更能缓解 reward hacking。
- 结果显示,EL 在两类策略模型上都优于传统 rubric-RL,反馈来源既可以是模型自身,也可以是专有模型。
所属事件:微软提出LLM-as-a-Coach以经验学习优化训练(4 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11