新研究称,智能体技能要看回归而不只看平均收益
omarsar0 · x · 2026-07-27
这篇论文的核心结论是:评估 agent skills 不能只看平均成功率,因为这会掩盖“回归”——也就是某个任务本来不用 skills 能做对,加了 skills 反而做错。
作者在两个办公自动化基准、三套 model-harness stack 上做了接近 6000 组 paired runs,发现 skill 带来的影响不只是增益,还包括明显的负面副作用。论文总结出三种主要回归机制:
- skill-description osmosis:skill 仅仅出现在上下文里,就会改变 agent 行为,即使它根本没被调用。
- grounding displacement:skill 规定的流程会覆盖 agent 对输入的原有理解方式。
- verification displacement:skill 的流程会压制 agent 原本会做的检查。
论文认为,最好的 skills 往往不是“收益最大”,而是回归最少;许多 persistent failure 实际上出在 grounding 和 verification 阶段。
所属事件:研究揭示 Agent 技能引入会带来 59% 回归税(2 条相关)→
「编程与Agent」频道最新
- Alchemy 新增 Kubernetes 文档中心,从 kind 集群到 EKS 部署全流程 — samgoodwin89 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- 调查:1/4 的 AI Agent 处于无人监控状态 — rseroter · 2026-09-23
- Massive 联手 Coinbase,AI Agent 可付费获取实时市场数据 — kleffew94 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23