技能为何失灵:56% 场景 agent 根本没调用 skill
Hydronix2731 · reddit · 2026-09-19
作者系统梳理了「skills 什么时候有效、什么时候白费」的证据:
有效时收益巨大
- Microsoft SkillOpt:一个表格 skill 让 Claude 在 SpreadsheetBench 从 22 分升到 82 分。
- NVIDIA 对 300+ 已验证 skill 做有无对比,正确率平均提升约 41 分。
- SkillsBench:精选 skill 平均加约 16 分,部分领域超 50 分——提升幅度接近换一代模型。
但常常完全无效
- Vercel 发现 56% 的情况下 agent 根本没检索到 skill;即使触发,也可能不起作用。作者实测 Claude 内置 /code-review 相比一句「review this code」提升有限。
什么时候 skill 才有用
- 只有当 skill 含模型本身不知道的知识(如何调用你的 API、仓库的数据库管理方式、MCP 调用细节)时才有增益;SkillsBench 显示医疗等领域收益最大、通用软件工程最小,模型自己写 skill 零收益。
如何评估你的 skill
- 标准方法是有/无 skill 两组跑同一任务集测差值。介绍了 NVIDIA SkillEvaluator 与 SkillsBench 的运行要求(API key、agent CLI、Docker/Modal 沙箱等)。
- 作者开源了 Terum:沿用 SkillEvaluator 架构但免配置,直接跑在订阅和自己的 harness 上,并追踪 skill 是否真的被触发;目前面向 Claude skills,后续扩展 Codex/Cursor。
「编程与Agent」频道最新
- 开发者用 Claude Skill 一键把图片里的建筑拆解成可调 Three.js 模型 — jasonkneen · 2026-09-20
- Cursor Pro 信用点消耗过快遭用户吐槽,月付 25 美元寻找替代品 — ReporterUnusual9295 · 2026-09-20
- Fuzzing 与 property-based testing 正在分化:一个管探索,一个管断言 — blaizedsouza · 2026-09-20
- 「软件工厂」观:LLM 只该负责生成,规约与验证不能交给它 — blaizedsouza · 2026-09-20
- 单条成本不到 1 美分:Jev 做 NSFW 提示词过滤的实测与阈值坑 — Murky_Ad8671 · 2026-09-20
- 启发式无法认证启发式:软件工厂的编排思路可能全错了 — blaizedsouza · 2026-09-20