Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6%

Salesforce · hf · 2026-10-09

Salesforce 在 Hugging Face 发布论文 Self-Retrospection Distillation(SRD),提出"前瞻学习"思路:利用交互后的经验监督交互前的预测,把事后才能获得的后见之明蒸馏进同一个策略。

核心问题与做法:

效果:在 10 项工具调用推理与长程 agent 任务上,SRD 相比 RLVR 与自蒸馏基线最高提升 24.2 个百分点。优势在奖励对比稀缺时尤其明显:当 37–98% 的 rollout 组奖励一致时仍能提取学习信号。2B 模型在 98% 组全失败的设定下,RLVR 成功率为 0.0%,加 SRD 后在同预算下达 60.6%。

结论:事后 agent 经验不仅可用于评估和改进行为,还能在交互可得之前塑造预测表征。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →