解构 Agent Skills:65.7% 靠流程锚定而非知识注入

Demystifying Agent Skills: Why They Work-Until They Don't

Zhiyuan Jiang, Fangrui Huang, Hanwen Xing, Xander Wu, Yipeng Gao, Rui Cao, Mengdi Wang, Shilong Liu, Yijiang Li

cs.AI

2026-08-14

对照实验显示 Skill 的作用 65.7% 是锚定流程、4.5% 是补知识;同一批轨迹下比 Workflow Memory 高 6.06 个点。

这篇在解决什么

Agent Skills 正在变成标配:Anthropic 开了公开技能仓库,各家 agent 框架都在做「把经验沉淀成可复用文件」。但现有评估只回答一个问题:加了 skill 之后总成功率涨没涨。涨了就当有用,没人说得清哪一部分在起作用,skill 怎么写、怎么检索、什么时候帮倒忙,全靠启发式试错。

普林斯顿、斯坦福、USC、UCSD、约翰霍普金斯的团队把这个问题拆成可控实验:同样的历史轨迹,分别整理成 Workflow Memory(清洗过的轨迹)和 SKILL.md(蒸馏出的标准化技能文件),配对比较,再对 8135 条试验记录做人工校验的轨迹编码,回答三个问题:什么时候有用、为什么有用、在哪里失效。

方法

三臂设计:Raw(不给历史经验)、Workflow Memory、Skill。轨迹池按成功/失败配比从 5 成功 0 失败排到 0 成功 5 失败,两种表征取自同一批轨迹、评同一批任务,唯一变量是经验的存在形式。两套 agent 配对(Codex + GPT-5.3-Codex、Gemini CLI + Gemini-3.1-Pro-Preview),跑 Terminal-Bench 2、Terminal-Bench Pro、SkillsBench 三个基准。

机制归因靠配对三元组:同一任务的三条臂各标一次行为模式。240 条开放编码轨迹收敛出 238 个有效标签、12 种模式、三大类;714 次轨迹-标签人工复核全部通过,人工与 LLM 归类一致率 95.8%(κ=0.952)。检索单独成组:技能池从 5 个扩到 100 个,干扰项分随机、语义相似、不相似三档,分别测 embedding 排序、agent 显式挑选、真实执行三种场景,三者互不传递结果。

结果

机制Skill 臂占比
流程锚定65.7%
知识注入4.5%

总成功率 Skill 61.9%、Raw 59.1%、Workflow Memory 55.9%。最稳的差异是 Skill 对 Workflow Memory +6.06 个点(bootstrap 95% 置信区间 +0.76 到 +11.36),两者同源,差值只能归给表征形式。

失败结构的变化更具体:环境搭建失败从 Raw 的 5.3% 降到 Skill 的 0.2%,输出格式错误 7.4% 降到 3.2%,后台服务生命周期失败 2.7% 降到 0.8%。算法逻辑错误(7.4%)和只做静态检查不跑运行时验证(11.7%)几乎不动:skill 稳住执行,救不了想错了解法的任务。新失败面随之出现,skill 被误用或无视占 Skill 臂 10.0%(Raw 仅 0.8%);Workflow Memory 的主要代价是超时(10.6%,Skill 为 4.4%),弯路和失败分支拖慢了执行。

检索是另一个故事。池子从 5 扩到 100,执行中实际用对 skill 的精度从 29.6% 跌到 3.3%,下游成功率反而从 36.4% 微升到 39.3%;k=100 时召回还有 54.3%–73.6%。离线侧 embedding 检索 top-1 从 88.3% 降到 76.9%,语义相似干扰项是主要压力(70.5% 降到 53.4%)。选对不保证成,用了近似的也不一定败。另外,失败轨迹进池后,创建 skill 时隐瞒成败标注明显掉分:Gemini 在 3 成功 2 失败配比下 0.7462,无提示只剩 0.4000。

为什么重要

三条结论直接可用。写 skill 把功夫花在流程上:步骤顺序、中间检查、工具序列、常见坑,别指望它补领域知识。token 账算得过来:83 个任务的匹配集上,Skill 比 Raw 高 5.5 个点还省 34.2K token,比 Workflow Memory 高 4.8 个点、多花 95.3K。检索精度崩了成功率没崩,「必须命中标注的标准答案技能」这个假设可以放弃,评估和系统设计都该跟着改。

局限与存疑

作者自认三条:只覆盖终端与工具类基准,无长程网页交互;agent-model 配置有限;分类法来自约 3% 的分层抽样,罕见模式可能漏。另有两点:RQ4 的 Codex 侧因原模型下线换用 GPT-5.4,论文声明这部分只能做组内比较;轻量基线对照(Skill 79.2% 对 Workflow Memory 62.3%)只在 26 个 Terminal-Bench-2 任务上跑过,全量是否成立未验证。

术语

原文与代码

社区讨论

相关论文

全部论文解读