Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6%
Salesforce · hf · 2026-10-09
Salesforce 在 Hugging Face 发布论文 Self-Retrospection Distillation(SRD),提出"前瞻学习"思路:利用交互后的经验监督交互前的预测,把事后才能获得的后见之明蒸馏进同一个策略。
核心问题与做法:
- RLVR 只用标量结果奖励做学习信号,当一组 rollout 全部获得相同奖励时信号消失,即便轨迹本身包含任务要求与失败原因的有用信息。
- SRD 把已完成轨迹中的"特权 hindsight"蒸馏为轨迹盲的 foresight,作为训练目标;推理时无需显式生成前瞻。
效果:在 10 项工具调用推理与长程 agent 任务上,SRD 相比 RLVR 与自蒸馏基线最高提升 24.2 个百分点。优势在奖励对比稀缺时尤其明显:当 37–98% 的 rollout 组奖励一致时仍能提取学习信号。2B 模型在 98% 组全失败的设定下,RLVR 成功率为 0.0%,加 SRD 后在同预算下达 60.6%。
结论:事后 agent 经验不仅可用于评估和改进行为,还能在交互可得之前塑造预测表征。
「编程与Agent」频道最新
- 给 Opus 加 Minecraft 世界记忆后进度提升 133%,WorldBox 沙盒发布 — Lianhuiq · 2026-10-09
- GPT-6 生成式 UI 走红后,下一代 Agent 缺的是生成式工作流层 — Over_Accountant_2311 · 2026-10-09
- Next Token 播客第 5 期:Personal Agent 大战与 AI 复刻软件影响 — op7418 · 2026-10-09
- mattyp 的 build a bot 支持语音反馈,每条反馈进队列交给 agent 修复 — mattyp · 2026-10-09
- 10 分钟用 Claude 逆向复刻 3D 像素 emoji 动画风格,做成可玩 artifact — justin_hart · 2026-10-09
- Delphi 讲解 Predict Anything 原理:LLM 报赔率+LMSR 市场结算 — benfielding · 2026-10-09