SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song
cs.AI
2026-02-13
SkillsBench 用 87 道可验证任务、18 套模型-harness 配对评测:精选 Skill 把平均通过率从 33.9% 提到 50.5%(+16.6 pp);1 到 3 个聚焦模块优于大包,自写 Skill 反而掉 8 到 11 pp。
Agent Skill 已经是终端 agent 的标配:一个文件夹里放 SKILL.md,再附脚本、模板、参考资料,推理时由 harness 发现并注入。社区快照里能数出 201.4 万份源分区 Skill。缺的是测量:加了这份 Skill,这道题到底多过了几道。
现有 agent 基准把模型、harness、增强手段揉成一个通过率。SWE-bench、Terminal-Bench 回答的是「这个 agent 能不能把活干完」,回答不了部署问题:「加上这份 Skill,同一套模型-harness 会不会更好,好多少」。SkillsBench 把 Skill 当成一等评测对象,用配对实验把增强效果从底座能力里拆出来。
任务来自 142 名贡献者的 400 份投稿,筛完留下 87 道、横跨 8 个领域。每道题是独立容器:人工写的指令、带数据的 Docker、必须能过 verifier 的 oracle、一套确定性 pytest。Skill 必须写一类问题的流程,不能写某一实例的答案;任务指令也不点名该用哪份 Skill,agent 走标准的渐进披露去发现。
评测在 BenchFlow 上跑 18 套模型-harness,每道题两个配对条件:只给指令,以及把该题精选 Skill 目录挂上。每格三次试验,主指标是任务宏平均通过率,辅以归一化增益(吃掉剩余空间的比例)。另有一组自写 Skill 诊断:agent 先用 Anthropic skill-creator 写包,再用这些包解题。
18 套配置全部上涨,平均通过率从 33.9% 到 50.5%,+16.6 个百分点,归一化增益 25.5%。配置间差很大:
| 配置 | 无 Skill | 精选 Skill | Δ |
| OpenHands + GPT-5.5 | 51.5 | 67.3 | +15.8 |
| Codex + GPT-5.5 | 46.8 | 66.5 | +19.7 |
| Claude Code + Opus 4.7 | 43.0 | 61.2 | +18.2 |
| Gemini CLI + Gemini 3.1 Pro | 36.0 | 60.8 | +24.8 |
| OpenHands + GLM 5.1 | 32.7 | 58.4 | +25.7 |
| OpenHands + Gemini 3.1 Flash Lite | 16.0 | 20.1 | +4.1 |
| 18 套平均 | 33.9 | 50.5 | +16.6 |
绝对最强不是涨幅最大的。GLM 5.1、Gemini 3.1 Pro、DeepSeek V4 Pro 吃到的增益,比已经很强的 Opus 4.8(+8.4)和 Gemini 3.5 Flash(+7.1)更大。同一模型换 harness,Skill 利用率也变:Gemini 3.1 Pro 在 Gemini CLI 上到 60.8%,在 OpenHands 上只有 52.8%;Opus 4.7 在 Claude Code 上 61.2%,在 OpenHands 上 53.1%。
自写 Skill 在三套专用 harness 上全部掉到无 Skill 基线以下:Claude Code −8.1、Codex −11.3、Gemini CLI −11.5。轨迹审计给出三个原因:写出来的包求解器根本没发现、写包挤掉了真正解题、用上了也锁进错误流程。
领域上,自然科学 +28.8、媒体制作 +24.1、网络安全 +18.9;软件工程 +11.6、数学与运筹 +9.7。涨最多的题几乎是从零起飞:llm-prefix-cache-replay 从 1.9% 到 94.4%,dapt-intrusion-detection 从 0 到 81.5%。87 题里有 13 题精选 Skill 反而更差,常见原因是 Skill 塞了一条过重的正确流程,挤掉了更简单的默认策略,或者把 agent 指向它 debug 不了的求解器。
设计消融更实用:挂 1 个 Skill +18.0 pp,2 到 3 个 +19.0,不少于 4 个只剩 +10.1。文档长度上,紧凑/标准(+19.0 / +21.5)远好过详尽(+14.5)和大全(+0.7)。MiniMax M2.7 带 Skill 到 34.9%,已经超过 GLM 5.1 不带 Skill 的 32.7%。
调用率也不是铁板一块。Codex + GPT-5.5 读到任务 Skill 的比例是 99.2%,OpenHands + Gemini 3.1 Flash Lite 只有 46.4%。OpenHands + Gemini 3.1 Pro 调用率 54.0%,一旦调用通过率升到 68.7%。高调用不等于高通过,低调用也确实存在。
给正在给 agent 堆 Skill 的人三条可执行结论。精选、短、带可执行脚本和 verifier 关心的格式约束,比写百科全书有用。同一份 Skill 在不同 harness 上差出近 10 个点,评测必须带上真实 CLI,不能只测一份「with Skills」。让模型当场自己写 Skill 再解题,在这套设定里比不用还差,至少现在别把自写当替代方案。
小模型带好 Skill,可以追上更大模型的裸跑。这是渐进改进,不是换底座。
任务全是终端容器,GUI、多 agent、超长地平线都没测。加 Skill 会拉长上下文,增益里可能混进「多喂了字」;自写条件把内容质量和发现失败搅在一起,还不能当干净的长度对照。基准 Skill 质量分 10.1/12,生态平均只有 6.2/12,真实仓库里的脏 Skill 会差一截。13 题负增益说明「正确流程」写死、不给轻量退路时,Skill 会害事。论文自己也说,随机文本、无关文档、检索-only 这些对照还没做。