检索工具「拒绝回答」一句话,搜索 Agent 弃答率从 23% 飙到 97%
_reachsumit · x · 2026-10-06
论文《Search Engines Never Say No》研究了一个被忽视的问题:搜索引擎从不「说不」——即使索引中没有答案,它也会返回 top-k 结果,导致搜索 agent 面对无关文本而瞎猜。研究者构建了一个「索引空洞」测试床(257 个 NQ 和 300 个 HotpotQA 问题,分别在含/不含 gold passage 的 2100 万文档 BM25 索引上运行),测试 7 个 frozen agent 对 5 种拒绝措辞的反应。
关键结果:
- 一句不显式宣告的拒绝消息,使 Qwen3-8B/32B 在不可答问题上的弃答率平均从 23% 升至 97%,Claude Haiku 4.5 从 28% 升至 57%,错误答案几乎一一对应减少;比在 system prompt 里写指令平均高 51 分。
- 异常行为:Search-R1 无视拒绝并编造检索结果;Claude Sonnet 5.5 与 Opus 5.5 凭记忆作答(弃答仅 +2),但遵守 observation 内的指令时弃答 +16。
- 措辞很重要:解释式拒绝胜过单个词;soft warning 无效。
- 现实可用的触发器(从轻量打分预测器到 LLM grounding judge)都远低于 oracle,全部落在「收益 vs 信号质量」曲线上;对合规 agent 而言瓶颈在工具内部的检测器而非 agent。
「编程与Agent」频道最新
- Matt Pocock:把 AI 编码技能定制成你自己的工作流 — mattpocockuk · 2026-10-06
- 斯坦福 ACE 团队推出 Sentry:失败知识常驻上下文反而拖累 Agent — StanfordAILab · 2026-10-06
- 防 Claude 封号:Shadowrocket 七步 TUN 配置堵漏指南 — aigclink · 2026-10-06
- ChatGPT 插件提交流程简化:上传 zip 即可送审 — Dimillian · 2026-10-06
- 一个工具搞定抓取+提取:开发者实战解决 Agent 上下文溢出 — OkShirt9372 · 2026-10-06
- 跑了几十小时端到端基准,Strata 推理服务器在完整构建任务上翻车 — julianharris · 2026-10-06