Apple 提出 RLTL;DR:失败后自写反馈,让 agent 在无解任务中自我改进

Apple ML Research · rss · 2026-10-01

Apple ML Research 发布论文 RLTL;DR,解决自我改进场景下 RLVR 的局限:当任务难度过高、agent 几乎不可能成功、又没有教师模型或示例可蒸馏时,传统「多次尝试、奖励成功」的范式失效。方法是在每次失败后把验证器输出展示给策略,让它自己写一条 TL;DR 形式的洞察作为反馈,并以此为条件引导下一次 rollout,实现从失败中内部化学习。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →