新研究:检索到的 Agent 技能可能正在悄悄拖累任务表现
dair_ai · x · 2026-09-03
一项针对 agent 技能检索的测量研究指出:聚合分数提升的技能,可能恰恰在伤害它实际触达的任务。
问题所在:常规对比方式是把「检索了技能的任务」与「没检索的任务」作比较,但这是不同任务,混淆了检索效果与「哪些任务触发检索」这两个因素。
提出的修正:论文设计了 Retrieval-Invoked Actual-Use Effect(检索实际使用效应)——同一任务跑两遍,一次开启技能、一次关闭,只统计 agent 真正检索了内容的任务,做成配对比较。
关键发现:
- 跨 17 个 LLM、在编程与数学任务上,模型常出现「聚合检索收益为正,同任务效应为负」
- 在 MBPP+ 上,多个系统层面看似有益的模型,恰恰在检索被触发的任务上表现变差
对任何维护 agent 技能库的人来说,这是一个值得警惕的评测方法论警示。
「编程与Agent」频道最新
- NeurIPS 2026 医疗智能体研讨会公开招募审稿人 — mdredze · 2026-09-03
- 生产环境 AI 配置怎么选?Reddit 团队热议成本、质量、延迟权衡 — BasePsychological899 · 2026-09-03
- 开源 demo:AI 智能体黑盒自研高尔夫球飞行物理 — burny_tech · 2026-09-03
- Codex 跑 26 天用 62 万行 C++ 重写《红色警戒 2》,登陆 iOS/macOS — daniel_mac8 · 2026-09-03
- 作者用自建 SNES Agent 几秒生成可玩复古街机游戏 — tekbog · 2026-09-03
- PaperCompiler:仓库级规格编译实现忠实论文转代码 — nanyang-technological-university-singapore · 2026-09-03