微软研究:Agent Skill 有时有害,307 个失败案例揭示陷阱
coallaoh · x · 2026-08-16
微软研究院等团队发布论文《Agent Skills Can Be Harmful》,系统研究了 Agent Skill 如何导致任务失败和效率下降。
- 在 SkillsBench 和 SWE-Skills-Bench 上发现 307 个 Skill 引发的问题:125 个功能性失败,182 个效率回归。
- 意外发现:大多数失败并非由完全不相关的 Skill 引起,而是看似相关的 Skill 让 Agent 过度依赖模板和默认做法,遗漏任务真正要求,68.8% 的功能性失败属于此类。
- 效率问题主要源于 Skill 导致 Agent 增加不必要的流程,如反复验证和过重的实现步骤。
- 作者提出 SkillTriage 工具,用于归因和分类 Skill 引发的问题。
- 研究提醒:Skill 的价值不能只看是否被调用,还需评估其在具体任务中的实际帮助;未来需要评估、回归测试和淘汰机制。
「编程与Agent」频道最新
- 交互用快模型,后台用慢模型:Grok 4.6 的场景定位 — vikvang1 · 2026-08-16
- Grok Build VS Code 插件与桌面端更新 — PawelHuryn · 2026-08-16
- Grok IDE 中继服务开源,设计假设服务器为敌对环境 — PawelHuryn · 2026-08-16
- 开源数据集查看器:AI Agent构建,秒开100GB+文件 — tom_doerr · 2026-08-16
- langctl:一键脚手架部署 LangChain 生产级 Agent — hwchase17 · 2026-08-16
- 用 AI 写游戏请分离配置文件,优化参数调试体验 — zack_overflow · 2026-08-16