字节与莫纳什论文把任务经验蒸馏进软件代理权重
imjustnewatai · x · 2026-07-25
这篇 ByteDance Seed 与 Monash 的论文提出了一种“收集任务经验 → 蒸馏进权重 → 删除轨迹”的 agent 训练循环。
做法是让 agent 对同一软件任务尝试多次,把它的命令、失败补丁、测试结果和最终修复整理成 experience trace,再把这些经验蒸馏进模型参数。论文在 749 个软件任务 上报告:
- base model:5.3% pass@1
- 普通微调:8.0%
- PPO:17.7%
- experience distillation:51.4%
同时,experience distillation 只用了 PPO 的 1/9.6 环境交互。把“收集 → 蒸馏 → 清除”循环重复 5 次后,性能从 7.1 提升到 47.0。在 494 个保留任务 上,包括完全未见过的仓库,pass@1 也从 4.62% 提高到 8.84%。
作者强调这还不是递归自我改进:每轮仍需要离线更新权重,且使用的是未公开的内部模型。不过文章的核心判断很明确——experience 可能会成为 agent 的下一条 scaling axis。
「编程与Agent」频道最新
- Andrew Ng发布免费一小时课程,讲Agentic知识图谱 — goyalshaliniuk · 2026-07-25
- Databricks称Genie Code在401个真实任务上胜出且每题仅0.55美元 — DbrxMosaicAI · 2026-07-25
- Claude Code 新增去 AI 味写作 skill,能改稿也能检测 — aigclink · 2026-07-25
- 面向编程工作流的多智能体编排提示词 — doodlestein · 2026-07-25
- ChatGPT Cowork 加入虚拟机,专门测试复现实验材料 — RobbWiller · 2026-07-25
- Rust 新库让多智能体并行编码不再被钩子拖慢 — arthurcolle · 2026-07-25