第一手检索定成败:Question's Gambit 把 agent 答题准确率提至 90.5%
_reachsumit · x · 2026-09-15
研究深度研究型 agent 的「第一步检索」设计:- 观察:agent 常能召回含证据的文档,却无法把它们连到 gold 文档;- 提出 Question's Gambit:搜索循环开始前,先把问题拆成一组线索、改写成互补查询、合并检索结果并重排候选池,为后续线索聚合与答案验证铺好开局上下文;- 在 BrowseComp-Plus 上用 gpt-5.5 把答案准确率从最强 agent 基线 Pi-Serini 的 83.1% 提到 90.5%,并在 MultiHop-RAG 上验证了迁移性;- 结论:agentic 深度研究的效果不只取决于循环内的工具,也取决于开局这一手怎么打。
「编程与Agent」频道最新
- MiniMax 发布 Design 创作台:一个 brief 驱动 Agent 全流程出片 — Hailuo_AI · 2026-09-15
- Anthropic 详解如何约束自家 Agent:gVisor、沙箱与受限虚拟机 — emmanuelvivier · 2026-09-15
- AI 时代怎么写测试:六条规则治住 mock 泛滥与脆弱测试 — dotey · 2026-09-15
- Qdrant 工程师分享:让研究 agent 从自身运行历史中自我改进 — qdrant_engine · 2026-09-15
- XWiki 澄清:正在做的 MCP 服务器是可选集成,不会强制内置 AI 助手 — LorinaBalan · 2026-09-15
- 开发者感慨:实现投屏其实很简单,codex 和 claude 都绕了大弯 — ezshine · 2026-09-15