Question's Gambit:检索前预处理让 GPT-5.5 深研成绩从 83.1% 升至 90.5%
omarsar0 · x · 2026-09-22
一篇论文提出 Question's Gambit 方法,证明深度研究 agent 的第一步检索至关重要——只改开场上下文就能大幅提升成绩:
- 在 BrowseComp-Plus 上,同样的检索器和 agent 循环下,GPT-5.5 从 83.1% 提升至 90.5%,GPT-5.4-mini 从 68.1% 提至 79.0%,DeepSeek-v4-pro 从 71.4% 提至 76.9%
- GPT-5.5 的校准误差约减半;代价是每题多花 2.3–5.3 次工具调用
- 方法:在 agent 开始搜索前运行一次,把问题拆成线索(clues),为每条线索生成互补搜索,汇总结果并重排,agent 循环带着这份已排序列表开局
- 错误分析:GPT-5.5 剩余 79 个错误中仅 3 个源于 gold 文档未被召回,其余 76 个发生在后续环节
「编程与Agent」频道最新
- Deel 推出企业运营 Agent 平台 Akai,演示一次即可自动化工作流 — kimmonismus · 2026-09-22
- Uncle Bob 演示 uml-viewer:用 UML 审阅 agent 生成的项目 — blaizedsouza · 2026-09-22
- 渐进式披露:agent 代表人类社交时逐步释放信息的用法 — iamrobotbear · 2026-09-22
- Qwen 3.8 27b 微调版输出冗长减 40%,质量基本无损 — julianharris · 2026-09-22
- 用户抱怨 Codex 桌面端不显示 agent 执行了哪条命令 — amplifiedamp · 2026-09-22
- AWS 资深工程师长文:编程从来不是我的工作本身 — blaizedsouza · 2026-09-22