RLTL;DR 论文:自生成反馈让 Pass@128=0 的任务破防至 14-31%

burny_tech · x · 2026-10-01

Michael Kirchhof 等人发布论文 RLTL;DR,提出一种突破 RLVR 学习瓶颈的自改进方法。核心思路:在可验证奖励强化学习中,当任务难到智能体几乎不可能成功(Pass@128=0)时,传统 GRPO 优化无从下手。RLTL;DR 让策略在每次失败后看到验证器输出,并自己写一条 TL;DR 式的经验总结;下一次 rollout 以所有历史 insight 为条件,直到找到解。关键创新在于对 in-context 的 insight 做反向传播,内化「任务→洞察」的直接映射。实验:在 Pass@128=0 的工具调用与编程数据集上,Qwen 3.5 9B Thinking 用标准 GRPO 训练 Pass@1 停留在 0-1%,而 RLTL;DR 训练时达到 14-31%,且评测时不给任何 insight 也能保持 12-13%,证明内化确实发生。作者还将其简化为只用 (任务, insight) 元组训练的 SFTL;DR 以进一步研究内化机制。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →