arXiv 论文:Agent Skills 可能有害,307 起失败可归因到具体 skill
alex_verem · x · 2026-08-21
arXiv 论文《Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents》(2608.11888)对 skill 诱发的 agent 失败做了系统归因分析。作者提出了一个差分分析框架:把 skill 引导的运行与「无 skill」或「语义匹配 skill」的参照运行对比,把任务失败或成本回退归因到具体加载的 skill,并在 SkillsBench 与 SWE-Skills-Bench 上实例化,产出 307 起 skill 诱发失败(125 起功能失败、182 起效率回退)。
论文还构建了 SkillTriage——一个分类法驱动的归因工具,对成对案例做归一化、抽取差分证据并生成分诊报告。主要发现:功能失败极少由明显无关的 skill 造成,反而是看似相关的 skill 常让 agent 错误实现或遗漏任务要求的实现要素;效率回退则表现为 token 消耗与执行时间的增加。
所属事件:论文实证 AI Skill 或致 Agent 失败:307 起案例归因(2 条相关)→
「编程与Agent」频道最新
- 松下航空联手 AWS:用多智能体 AI 加速飞机故障诊断 — AWS ML Blog · 2026-08-22
- MiniMax-H3 视频修复移植 diffusers 模块化管线,6 步换主体 — linoy_tsaban · 2026-08-22
- LangChain 推出 AI 导师:用 Coding Agent 辅助学习 — LangChain · 2026-08-22
- AI社交媒体Agent展示10倍于人类的互动量 — RichardsonDx · 2026-08-22
- Fable 提示词:做编排验收,任务派发给 Subagent — dotey · 2026-08-22
- Gemini 3.7 Flash 拿下 CAD 计算机使用评测第一 — DynamicWebPaige · 2026-08-22