字节与莫纳什论文把任务经验蒸馏进软件代理权重
imjustnewatai · x · 2026-07-25
这篇 ByteDance Seed 与 Monash 的论文提出了一种“收集任务经验 → 蒸馏进权重 → 删除轨迹”的 agent 训练循环。
做法是让 agent 对同一软件任务尝试多次,把它的命令、失败补丁、测试结果和最终修复整理成 experience trace,再把这些经验蒸馏进模型参数。论文在 749 个软件任务 上报告:
- base model:5.3% pass@1
- 普通微调:8.0%
- PPO:17.7%
- experience distillation:51.4%
同时,experience distillation 只用了 PPO 的 1/9.6 环境交互。把“收集 → 蒸馏 → 清除”循环重复 5 次后,性能从 7.1 提升到 47.0。在 494 个保留任务 上,包括完全未见过的仓库,pass@1 也从 4.62% 提高到 8.84%。
作者强调这还不是递归自我改进:每轮仍需要离线更新权重,且使用的是未公开的内部模型。不过文章的核心判断很明确——experience 可能会成为 agent 的下一条 scaling axis。
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11