EMNLP 论文:17 个 LLM 检索技能后反而在原任务上变差
rohanpaul_ai · x · 2026-09-08
论文《Skill Following》提出新指标 RAE(Retrieval-Invoked Actual-Use Effect),专门测量 LLM agent 在真正触发技能检索的那些任务上,检索是否真的有帮助。
核心发现是一个评估悖论:
- 传统评估拿「检索了技能的任务」与「没检索的任务」整体对比,存在严重选择偏差,会高估工具使用能力。
- 作者对 17 个 LLM 在编程与数学领域实测,发现多个模型在 MBPP+ 上整体检索增益为正,但在实际触发检索的任务上表现反而变差(负 RAE)。
- 结论:聚合平均分会制造「会用工具」的假象,应改用同任务配对对比来衡量检索到答案这条链路的真实收益。
论文已被 EMNLP 2026 Findings 接收。
所属事件:多项研究揭示 Agent 技能检索的双刃剑效应(4 条相关)→
「编程与Agent」频道最新
- AI操控酵母菌落挑选仪,全自动酵母工程实现 — nlarusstone · 2026-09-08
- 开源chalkboarding技能:AI生成黑板风格教学动画 — Madisonkanna · 2026-09-08
- 调试 Agent 工作流:trace 里看着健康的步骤,凭什么敢排除? — Sensitive-Parsnip-12 · 2026-09-08
- Notch 晒体素渲染器压测:一条渲染管线描述都不用写 — anselm · 2026-09-08
- Agent 犯错之后谁来兜底?生产团队呼吁「可回滚层」 — Anxious-Variation508 · 2026-09-08
- 智库高管吐槽:没见过高智商的人同时跑一堆随机 Agent — examachine · 2026-09-08