新研究:检索到的 Agent 技能可能正在悄悄拖累任务表现

dair_ai · x · 2026-09-03

一项针对 agent 技能检索的测量研究指出:聚合分数提升的技能,可能恰恰在伤害它实际触达的任务。

问题所在:常规对比方式是把「检索了技能的任务」与「没检索的任务」作比较,但这是不同任务,混淆了检索效果与「哪些任务触发检索」这两个因素。

提出的修正:论文设计了 Retrieval-Invoked Actual-Use Effect(检索实际使用效应)——同一任务跑两遍,一次开启技能、一次关闭,只统计 agent 真正检索了内容的任务,做成配对比较。

关键发现:

对任何维护 agent 技能库的人来说,这是一个值得警惕的评测方法论警示。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →