LLM agent 连做任务涨 16.9%,北大基准:技能库不是头号功臣

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang

cs.AI, cs.CL, cs.LG

2026-08-05

北大 ContinualSkillBench 基准发现:agent 连做任务能涨 16.9%,但维护技能库并不比单纯留上下文更强,涨点主要来自对历史反馈的适应。

这篇在解决什么

给 LLM agent 配「技能库」已经是主流做法。Claude Code、Codex 这类工具都让模型把常用操作写成结构化的 skill 文档,需要时取出来用。问题是这些 skill 多半是人手写死、外部塞进去的。真正落地时任务会源源不断地冒出来,agent 能不能自己在完成任务的过程中把经验沉淀成可复用的技能、并且让后续任务越做越好,这件事一直没人系统量过。

传统让模型适应新任务的法子是微调权重,而这会触发 catastrophic forgetting(灾难性遗忘,模型学了新的就把旧的忘了)。于是大家转向 in-context continual learning(上下文内的持续学习),靠长上下文窗口把技能库越攒越多、随用随取,不动权重。ContinualSkillBench 要回答的就是这条路到底走通没有,走通了又是靠什么走通的。

方法

ContinualSkillBench 覆盖五个领域:医疗、法律、数学、金融、办公。每个领域 100 个相互关联的子任务,锚定三项核心技能,按难度和技能依赖关系排成一条由易到难的链,让后面的任务天然依赖前面练过的技能。

任务构造分三步。先从约 3 万个候选任务(来自 OlympiadBench、LawBench、TAT-QA、GAIA、ClawBench 等)里让模型标注所需技能、过滤、评难度;再对每个领域抽 200 对任务做双向依赖判定,拼成有向依赖图,用 Kahn 算法排序;最后人工复核。作者验证了这条链确实连贯:69.5% 的合格任务至少复用了一个早先出现过的核心技能。

每个子任务走三轮协议:agent 拿到任务和当前技能库,执行,再根据评测反馈反思,可以用「Create Skill」「Modify Skill」这两个元技能去新建或改写技能。评估用四类评测器,分别是精确匹配与 F1、带容差的数值、LLM 评分标准判定、可执行程序测试,并定义两种奖励:对全部 100 个任务求平均的 raw reward,以及只算两种设置下都产出有效输出的任务子集的 normalized reward。

关键是它对比了三种执行模式:Independent(每个任务清空历史和技能库从零开始)、Sequential(连续做 100 个、全程保留并更新技能库)、Pure ICL(同样的上下文和反馈,但不许创建或修改技能)。

结果

测了三个模型:GPT-4o、GPT-5.3-Codex、Claude 4.7 Opus。

连续执行(Sequential)在 15 个模型×领域组合里,有 14 个提升了 normalized reward。宏平均绝对提升 raw +0.071、normalized +0.078,折合相对提升 16.2% 和 16.9%。

模型normalized 增益
GPT-5.3-Codex+0.098(三模型最大)
GPT-4o+0.077
Claude 4.7 Opus+0.058(基线最强但增益最小)

按领域看,医疗涨得最猛(+0.149),其后是金融(+0.076)、法律(+0.058)、办公(+0.054)、数学(+0.052)。唯一退步的是 Opus 4.7 在数学上(-0.008)。具体到格子:GPT-5.3-Codex 在医疗的精确匹配从 0.321 冲到 0.857(+0.536),金融 F1 从 0.417 到 0.833;GPT-4o 在医疗从 0.107 到 0.429。

ICL 那组对照更说明问题。在法律、金融、医疗上用 GPT-5.3-Codex,三种模式的 normalized reward 分别是 Independent 0.466、Pure ICL 0.605、Sequential 0.602。换句话说,精心维护技能库在整体上并不比「只是把上下文和反馈留着」更好。差别藏在细分项里:显式技能在法律和金融的精确匹配上更准,把医疗的可执行程序测试从 0.250 拉到 0.500;而 ICL 在三类任务的 LLM 评分(Rubric)上全面更高。

技能库本身也暴露了模型差异。GPT-5.3-Codex 在五个领域攒了 205 条技能,体量小但被反复调用;GPT-4o 攒了 384 条,体量更大、复用更少、质量评分更低,作者形容为「碎片化、任务特定」。

为什么重要

对做 agent 的人,最该记的一条是:连续做任务时的涨点,大头来自模型对历史上下文和反馈的适应,不是来自那套显式的技能抽象。这意味着花大力气搭技能维护与检索机制,平均回报可能不如把上下文喂足、把反馈写好。但这是平均结论,如果你的任务高度依赖可复用的固定流程,或要求精确输出,显式技能仍然值钱。

第二条是诊断信号。越弱的模型越倾向于堆一个臃肿、零碎的技能库,而不把它合并成可迁移的通用技能。把技能库规模和复用率摆出来,就是模型是否真在沉淀能力的一面镜子。

局限与存疑

作者自己点明:五个领域够用,但任务都来自固定的若干个 benchmark 源,真实部署里的长尾、分布漂移、格式各异的指令没覆盖到;因为连续评测的时间和 API 成本太高,只测了三个模型加 Codex CLI、Claude Code 两套框架,没覆盖 Cursor、Google CLI,也没穷举更多 Claude/GPT/Gemini 版本;另外这套任务流是有序、清洗过的,真实场景更杂乱;最后它只研究生成式技能演化,不碰权重更新那类持续学习。

还有两处没拆开。其一,normalized reward 只算两种设置下都有效的任务交集,Sequential 比 Independent 多出来的收益,究竟有多少来自它把更多任务做到「有效输出」、从而进了分母,又有多少来自单任务做得更好,论文没分离。其二,ICL 与 Sequential 几乎打平这件事是在三个领域、一个模型上得出的,通用性还得看更多设置。

术语

原文与代码

社区讨论

相关论文

全部论文解读