经验蒸馏复现:保住 44.1% 的代理 ICL 增益
burny_tech · x · 2026-07-29
一组作者对论文 《Sample-Efficient Learning from Agent Experience》 做了小规模复现,结论是:经验蒸馏可以把代理在上下文里的学习收益,部分“压缩”进模型参数里。
- 他们用 GPT-5.6-Sol 和 Fable 5 组成研究代理集成,在 SWE-smith 任务上,用 Tinker 对 Qwen3.5-9B 做后训练。
- 复现结果显示,EPD(Experience to Policy Distillation)保留了 44.1% 的 ICL 增益;而传统 SFT 几乎没有保住这部分收益,图里显示为 0%。
- 两个消融结果也很反直觉:
- 只拿每个任务最后一次成功试验做 SFT,反而比“把所有 trial 都拿来做 SFT”更差;
- 每个 trial 采样 4 条 teacher 序列,在步数相同或按比例增加时,表现都不如只采样 1 条。
- 配图里,Fresh ICL 仍是最强基线,而 EPD 的不同变体在通过率和归一化收益上都介于 SFT 和 ICL 之间。
「编程与Agent」频道最新
- Claude Opus 5 在 DeepSWE 夺魁,号称成本还低 28% — daniel_mac8 · 2026-07-29
- Claude 文件夹把原始资料变成自更新第二大脑 — wschroll · 2026-07-29
- Opus 5 发布 5 天,社区已能生成整站和完整游戏 — heypearlai · 2026-07-29
- Opus 5 已能无外部素材生成完整 Minecraft 作品 — heypearlai · 2026-07-29
- Opus 5 发布 5 天,社区已在晒完整游戏 demo — heypearlai · 2026-07-29
- AI 代理手机到底是什么,为何移动端流程离不开它 — Petesneaknex · 2026-07-29