新研究称,智能体技能要看回归而不只看平均收益
omarsar0 · x · 2026-07-27
这篇论文的核心结论是:评估 agent skills 不能只看平均成功率,因为这会掩盖“回归”——也就是某个任务本来不用 skills 能做对,加了 skills 反而做错。
作者在两个办公自动化基准、三套 model-harness stack 上做了接近 6000 组 paired runs,发现 skill 带来的影响不只是增益,还包括明显的负面副作用。论文总结出三种主要回归机制:
- skill-description osmosis:skill 仅仅出现在上下文里,就会改变 agent 行为,即使它根本没被调用。
- grounding displacement:skill 规定的流程会覆盖 agent 对输入的原有理解方式。
- verification displacement:skill 的流程会压制 agent 原本会做的检查。
论文认为,最好的 skills 往往不是“收益最大”,而是回归最少;许多 persistent failure 实际上出在 grounding 和 verification 阶段。
「编程与Agent」频道最新
- AI agent 发现 Bun 的 `child_process.spawn` 兼容性旧 bug — steipete · 2026-07-27
- Higgsfield 推出 MCP,把 Claude 直接接到图像视频生成 — mhdfaran · 2026-07-27
- 把 Higgsfield 接到 Claude 后可直接聊天生成视频 — mhdfaran · 2026-07-27
- Claude 结合 Higgsfield MCP 做出无脸短视频全流程 — mhdfaran · 2026-07-27
- OpenAI Codex 工程师演示如何用一个智能体管理工作流 — petergyang · 2026-07-27
- Codex 用户把“像我写作”技能打包成插件 — petergyang · 2026-07-27