论文揭示 agent 技能检索评测陷阱:整体变好,检索任务反而变差
rohanpaul_ai · x · 2026-09-08
一篇论文指出 skill-enabled agent 评测中的一个隐蔽失效模式:检索带来的整体提升可能掩盖检索任务本身的性能下降。
问题所在
- 现有评测多采用有缺陷的对比:比较「agent 选择检索技能的任务」与「未检索的任务」的得分。
- 但这两类任务可能本质不同。如果 agent 倾向在简单问题上检索技能,检索就会「看起来有用」——即使技能本身没起作用,甚至把答案变得更差。
解决方案:RAE
- 做法很简单:凡是发生检索的任务,都在无技能访问的条件下重跑同一任务,直接对比两次结果。
- 这样才能分离出技能检索在该任务上的真实因果贡献。
所属事件:论文揭示技能检索评测陷阱:整体变好可能掩盖退化(2 条相关)→
「研究」频道最新
- 77M 参数纯合成数据训练,Mitra-v2 登顶表格建模基准 — chaumian · 2026-09-08
- 索尼 AI 推出 Hakken 系统:从 150 万条假说中实证 2 项衰老基因新关系 — i_dg23 · 2026-09-08
- 从零搭建异步 RL 框架:JAX 多智能体训练实战工作日志 — yoshiyama_akira · 2026-09-08
- 用模型预判安全研究者的偏好:TASTE 评测基准登场 — burny_tech · 2026-09-08
- EMNLP 2026 论文:文本世界模型该比「行为一致」而非文本相似,假阳性率 42.5% 降至 9.5% — 机器之心 · 2026-09-08
- 港科大联合腾讯 ARC 发布 Track4World:前馈模型追踪全部像素 3D 轨迹 — rsasaki0109 · 2026-09-08