RLTL;DR 论文:自生成反馈让 Pass@128=0 的任务破防至 14-31%
burny_tech · x · 2026-10-01
Michael Kirchhof 等人发布论文 RLTL;DR,提出一种突破 RLVR 学习瓶颈的自改进方法。核心思路:在可验证奖励强化学习中,当任务难到智能体几乎不可能成功(Pass@128=0)时,传统 GRPO 优化无从下手。RLTL;DR 让策略在每次失败后看到验证器输出,并自己写一条 TL;DR 式的经验总结;下一次 rollout 以所有历史 insight 为条件,直到找到解。关键创新在于对 in-context 的 insight 做反向传播,内化「任务→洞察」的直接映射。实验:在 Pass@128=0 的工具调用与编程数据集上,Qwen 3.5 9B Thinking 用标准 GRPO 训练 Pass@1 停留在 0-1%,而 RLTL;DR 训练时达到 14-31%,且评测时不给任何 insight 也能保持 12-13%,证明内化确实发生。作者还将其简化为只用 (任务, insight) 元组训练的 SFTL;DR 以进一步研究内化机制。
「编程与Agent」频道最新
- DerivAudit 框架审计智能体记忆:约 20% 记忆缺历史证据支撑 — newyorkuniversity · 2026-10-01
- Orbio 推出 Incognito:为智能体提供端到端加密推理请求 — econoar · 2026-10-01
- TypeScript 框架 Effect v4 发布:零依赖,面向 AI 智能体构建 — DavidKPiano · 2026-10-01
- Astra 6 极速模式实测:300 tokens/s 改变 agent 交互方式 — soumitrashukla9 · 2026-10-01
- URL 黑名单挡不住 Agent,评测防护只剩白名单一条路 — xeophon · 2026-10-01
- Claude 学会先请示了:跑命令前问一句「我能执行吗」 — Aizkmusic · 2026-10-01