检索技能聚合涨31.6点,同题对照DeepSeek实际掉9.1点

Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents

Seonghyeon Cho, Chanjun Park

EMNLP 2026

cs.CL

2026-09-01

崇实大学用同题开关测17个LLM:聚合检索涨点常与RAE符号相反。DeepSeek-V3.2在MBPP+聚合+31.6点,在真正检索发生的题目上掉了9.1点。

这篇在解决什么

Agent 现在普遍挂一个技能库,检索 SKILL.md 再答题。评测却经常只问两件粗的事:整张榜平均有没有涨,以及「检索过的题」是不是比「没检索的题」更准。

后一种对比有硬伤。模型自己决定什么时候检索,检索过的题和跳过的题本来就不是同一批:难度、题面、技能库相关度都可能不同。整榜平均还会被大量从未检索的题稀释。真正该问的更窄:模型一旦检索并把技能塞进上下文,这道题有没有比它不用技能时做得更好?

方法

把检索到答题的整条链叫 Skill Following(技能跟随,SF)。协议很朴素:同一道题跑两次。

技能库是固定的程序性 Markdown:编码 9 条(二分边界、哈希计数、滑动窗口等),数学 8 条(换元、分情况、模运算等),结构仿 AgentSkill 的 SKILL.md。

三个指标别混:

RAE 是协议条件下的同题信号,不是对全体题目的无偏因果效应。主文报告阈值是检索子集至少 10 道题。

结果

17 个模型,编码主战场是 MBPP+ 的 80 题抽样(三个种子)加 HumanEval+,数学用 Math500 的 80 题抽样。MBPP+ seed 42 上,符号经常对不上:

模型聚合检索涨点RAE
DeepSeek-V3.2+31.6−9.1
Gemini-2.5-Flash-lite+6.2−15.6
Llama-3.3-70B+69.8+4.2
Qwen3-235B−0.1+7.0
Claude-4.5-H+1.4+1.4

Gemini-2.5-Flash-lite 三个 MBPP+ 分区聚合都为正,RAE 全是负。HumanEval+ 上 13 个可报告模型里 3 个符号相反,方向反过来:Qwen3-8B、Qwen3.5-9B、Qwen3-235B 聚合为负、RAE 为正。主报告阈值下,MBPP+ seed 42 有 5/13 个格子符号打架。

数学侧同样翻脸。Llama-3.3-70B 在 Math500 聚合 +14.2 点,RAE −39.4 点(帮助 3 题、伤害 42 题、检索子集 99)。Gemini-2.5-Flash-lite 聚合 +13.2、RAE −11.0。

检索覆盖率高也不等于会用。DeepSeek-V3.2 在 MBPP+ seed 42 调用率和返回率都是 100%,结构依从率只有 18.8%,有效成功率 11.2%,RAE 仍是 −9.1。Gemini-2.5-Flash-lite 调用率 82.5%,依从 13.6%,有效 10.6%,RAE −15.6。

伤害翻转用 GPT-5.5 标注(对 SD 答案和正误标签盲评):DeepSeek 45 次伤害里 64.4% 是 ignored/independent,检索了但答里看不出吸收;另有 15.6% 把工具痕迹漏进最终输出。Gemini 40 次伤害里 72.5% 同样是忽略。

技能内容对照也压不掉负 RAE。把返回内容换成填充文本、随机技能或故意写坏的技能,DeepSeek 的池化 RAE 仍在 −9.1 到 −15.9,Gemini 在 −5.0 到 −17.9。空返回时 RAE 无定义,因为条件子集为空。

代表性格翻转也硬:Mistral-S-24B 在 MBPP+ 第三分区 RAE −45.5(1 次帮助、31 次伤害,n=66,McNemar p=1.54×10^{-8})。

为什么重要

给 Agent 挂技能库、看到检索率上升、整榜平均涨点,这三件事都还不能证明技能在干活。部署侧如果只报「开了 skills 平均更好」,可能只是模型爱在更简单的题上检索。

要查真实用量,至少做一次同题开关:同一题、同一解码,只差能不能检索,然后只在真正检索发生的子集上看帮助翻转是否多于伤害翻转。这对 SKILL.md 路线的产品评测是可落地的补丁,不需要换模型。

这篇是测量学警告,不是新的训练方法。Claude-4.5-H 四个格子符号一致且 RAE 非负,负 RAE 不是宿命。多数模型离「检索即增益」还远。

局限与存疑

作者自己划了边界:单轮编码和数学、固定 BM25 接口、固定小技能库。长程 Agent、可执行代码库、自然语言技能、带记忆和规划的系统,不能直接外推同一幅度。

RAE 的条件子集由 SE 自己选出来,所以它不是预处理总体的无偏因果效应,也不是模型级「会不会用技能」的能力分。要拆开检索质量、内容质量和融合质量,还缺 oracle 检索、只返元数据、强制全量技能、多种技能库构造,以及人工因果标注。

另外几处会让数字偏软。主实验每分区 80 题;若干小模型检索子集为空,直接从符号统计里消失。依从标注是 GPT-5.5 加分层人工抽检,不是全量人工。技能库只有 9+8 条程序性套路,和真实仓库里上百条互相打架的 SKILL.md 不是同一分布。

术语

原文与代码

社区讨论

相关论文

全部论文解读