arXiv 论文解密 Agent Skills:8135 次实验揭示技能何时有效何时失效
rohanpaul_ai · x · 2026-09-08
论文《Demystifying Agent Skills: Why They Work—Until They Don't》(arXiv:2608.14036) 通过跨基准、跨 agent 框架、跨 LLM 的对照实验,系统回答技能何时有效、为何有效、何处失效。
核心发现:
- 在匹配对比中,技能版比 Workflow Memory 高 6.06 分;技能的机制是让噪声轨迹变成「程序化锚定」,稳定执行(占 65.7% 的成功案例),而非注入缺失知识(仅 4.5%)。
- 检索是独立瓶颈:技能池从 5 扩到 100 时,实际使用精度从 29.6% 跌至 3.3%。
- 研究基于 8135 条对照实验记录,并从 240 条开放编码记录中提炼出三大类、十二种技能使用模式的分类体系。
结论:技能的价值在于稳定行动顺序、工具选择与验证步骤;技能在不匹配场景或被僵化遵循时反而有害。
所属事件:8135 次实验解密 Agent Skills 的有效与失效边界(2 条相关)→
「编程与Agent」频道最新
- DHH 的 Omarchy Linux 获 1550 万美元成立基金会,主打智能体排障 — vista8 · 2026-09-08
- CROCODIL 解决多 LLM 协作时「过度修改无关代码」问题 — jessyjli · 2026-09-08
- 用 Grok Bot 在 Figma 自动生成三联照片马赛克,设计苦活省 90% — mattyp · 2026-09-08
- x402 让智能体学会经济推理:每次调用都带价格标签 — kleffew94 · 2026-09-08
- 用 qwen3.8:27b 给小说做连续性审校,顺手造了个 git hook — walkingriver · 2026-09-08
- 开源 CLI hangnone:静态扫描 CI 里会卡死或静默失败的 Claude Code 调用 — Obluness · 2026-09-08