字节与莫纳什论文把任务经验蒸馏进软件代理权重

imjustnewatai · x · 2026-07-25

这篇 ByteDance Seed 与 Monash 的论文提出了一种“收集任务经验 → 蒸馏进权重 → 删除轨迹”的 agent 训练循环。

做法是让 agent 对同一软件任务尝试多次,把它的命令、失败补丁、测试结果和最终修复整理成 experience trace,再把这些经验蒸馏进模型参数。论文在 749 个软件任务 上报告:

同时,experience distillation 只用了 PPO 的 1/9.6 环境交互。把“收集 → 蒸馏 → 清除”循环重复 5 次后,性能从 7.1 提升到 47.0。在 494 个保留任务 上,包括完全未见过的仓库,pass@1 也从 4.62% 提高到 8.84%。

作者强调这还不是递归自我改进:每轮仍需要离线更新权重,且使用的是未公开的内部模型。不过文章的核心判断很明确——experience 可能会成为 agent 的下一条 scaling axis。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →