自演化 Agent 越用越强?AgentStream 评测:三成多配置反而退步

AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan

cs.AI, cs.LG

2026-08-01

把 6 个 agent 基准组织成任务流、组合评测 5 种自演化方法与 3 个前沿模型的框架,发现自演化在约三成配置下不升反降,最弱的基座模型三场景全负增益。

这篇在解决什么

LLM agent 的「自演化」是近一年的热门方向:agent 在完成任务后,把交互轨迹蒸馏成经验(可能是一段更好的提示词、一条记忆、一个可复用的技能),存下来留给后面的任务用。支持这套想法的前提是,经验会越攒越有用,agent 会越用越强。

但已有的评测几乎全是「独立评测」:每个任务孤立求解,做完就忘,性能跨任务求个平均了事。少数走向流式评测的工作,也只对单个基准、单个演化组件做流式。真实部署里,任务是一个接一个、跨领域混着来的——写完代码可能马上要做深度检索,再切回多轮对话。经验在这种环境下到底是帮忙还是添乱,此前没人系统量过。

AgentStream 补的就是这块。

方法

AgentStream 把六个主流 agent 基准(AppWorld 交互式编码、BFCL 多步函数调用、BrowseComp+ 深度检索、HLE 专家级推理、SWE-bench Verified 软件工程、Tau2 双控对话)组织成一条可配置的任务流,然后在测试时实例化三种流式场景,逐步放大流的范围和领域混合度:

在这三种场景上,作者组合评测了五种覆盖不同演化组件的自演化方法:ACE(演化上下文提示)、A-Mem(Zettelkasten 式记忆链接)、ReasoningBank(从成败轨迹蒸馏推理策略)、AutoSkill(抽取可复用技能)、Harness(联合更新提示词、技能与记忆)。基座模型用三个前沿模型:GPT-5.4-medium、Gemini 3.1 Pro-medium、Claude Opus 4.7-high。每个配置都对齐「不做自演化的 vanilla 基线」,看经验到底带来多少净增益。

结果

最核心的结论是盆冷水:自演化并不普遍有益,在相当一部分配置里直接输给 vanilla。

各场景汇总(45 = 3 模型 × 5 方法 个配置):

场景正收益配置平均增益Top-1 占比
Isolated34/45(75.7%)+1.37%38%
Sequential28/45(62.3%)+0.75%29%
Interleaved28/45(62.3%)+0.90%33%

Isolated 最稳,经验只在同领域内攒,自然最不容易帮倒忙。流一变复杂,正收益占比就掉到六成出头。

收益还被基座模型「卡」住。最弱的 GPT-5.4 三个场景全是负增益(从 -0.35% 到 -0.78%),五种方法里只有 A-Mem 偶尔翻正。作者把这归因于一个自举循环:经验质量取决于任务完成质量,弱模型做不对,攒下来的就是噪声,反而拖累后面。Gemini 3.1 Pro 和 Claude Opus 4.7 才稳定吃到正收益。

一个反直觉的点是收益对模型强度「非单调」:中等能力的 Gemini 在不少配置里增益反而比更强的 Claude 更大,并不是模型越强自演化越赚。

成本这边也分模型。在 Gemini 3.1 Pro 上,ReasoningBank 给出 +2.3% 增益的同时把成本压到 vanilla 的 64%,最划算;在 GPT-5.4 上,A-Mem 那 +3.2% 的增益是拿 577% 的成本换来的。方法选择跟模型强绑定:A-Mem 在 GPT-5.4 上领先,ACE 在 Gemini 上领先,换到别的模型排名就变。没有任何一种方法在所有模型、所有场景上通吃。

为什么重要

对做 agent 的人来说,这篇的价值不在给某个方法背书,而是先撤掉一个错觉。把「自演化」当成默认打开、就能越用越聪明的开关,是不成立的。要不要上、上哪种方法,取决于三件事:基座够不够强(弱模型上了反而掉分)、任务是不是跨领域混着来(混得越狠越要当心干扰)、以及方法跟模型的匹配(同一个方法在不同模型上排名能差出两位)。

可操作的建议也有:成本敏感、模型偏弱的场景,优先看 ReasoningBank 这类检索式、能顺手压成本的方案;跨领域流式场景,A-Mem 这种带检索、压干扰的方案在三个场景里增益都为正、波动也小。

局限与存疑

作者自己点明两条。一是「模型能力强弱」只是他们这套实验设置(基于 Exgentic 框架、特定提示和基准组合)下的经验观察,不是普适排名,换框架、换提示、换基准排序可能变。二是只覆盖了三种场景、六个基准,代表性但不穷尽。

读下来还有两点要打折。第一,增益的绝对值很小,大多在 1 到 2 个百分点,而且作者自己也说是基于单次评测,这点波动是否站得住噪声之外没讲透。第二,「收益被模型能力卡住」「对强度非单调」这两条规律,实际只建立在三个模型的数据上,样本薄,作为普适「定律」还撑不起来。当经验性的趋势提示可以,当定论要留余地。

术语

原文与代码

相关论文

全部论文解读