Apple 提出 RLTL;DR:失败后自写反馈,让 agent 在无解任务中自我改进
Apple ML Research · rss · 2026-10-01
Apple ML Research 发布论文 RLTL;DR,解决自我改进场景下 RLVR 的局限:当任务难度过高、agent 几乎不可能成功、又没有教师模型或示例可蒸馏时,传统「多次尝试、奖励成功」的范式失效。方法是在每次失败后把验证器输出展示给策略,让它自己写一条 TL;DR 形式的洞察作为反馈,并以此为条件引导下一次 rollout,实现从失败中内部化学习。
「研究」频道最新
- Ptarmigan-1 开放:无需 3D 结构的 AI 药物发现模型免费可用 — ycombinator · 2026-10-02
- 高通团队发布 IVD 基准:VLM 实时面对面问答仍远落后人类 — rishit_dagli · 2026-10-02
- 密歇根大学:换更可扩散的嵌入空间,连续扩散语言模型超越 GPT-2-M — umich · 2026-10-02
- 中科大 GraphForge:证据图锚定真实文件合成任务,2 千条轨迹显著提升 GDPVal — ustc-community · 2026-10-02
- CMU 提出预测信用协议:研究 agent 的科学解释能否带来预测增益?结果未定 — CarnegieMellonU · 2026-10-02
- FloWright 让多智能体工作流协同进化,小模型最高提升 7.41% — Xuehang Guo · 2026-10-02