Question's Gambit 模块登顶 BrowseComp-Plus,召回率 96.6%
CShorten30 · x · 2026-09-25
团队发布搜索 agent 模块 Question's Gambit,登上 BrowseComp-Plus 榜单召回率第一。核心洞察:deep research agent 的第一次检索动作至关重要。模块将问题分解为一组线索、改写为互补搜索、合并结果并在 agent 开始迭代前重排候选池。
关键结果
- 仅用 BM25 作为检索器即取得 96.6% 召回率,agent 搜索调用次数减少约 6 倍
- 相同 BM25 索引、相同 agent 循环,只改进开局动作
- 在 BrowseComp-Plus 上用 gpt-5.5 将答案准确率从最强 agentic 基线 Pi-Serini 的 83.1% 提升至 90.5%
- 在 MultiHop-RAG 上验证了收益可迁移到常规多跳问答结构
论文:arXiv:2609.14412
「编程与Agent」频道最新
- 开源插件 fable-advisor:让 GPT-6 Luna 写码、Opus 5.5 审查的多模型编排 — daniel_mac8 · 2026-09-25
- NeurIPS 2026 论文 SkillRL:7B 模型胜 GPT-4o 41%,靠技能进化 — cihangxie · 2026-09-25
- Weave Code Max 上线:10 美元月费撬动 50 美元编码用量 — ycombinator · 2026-09-25
- 疯狂科学实验:让 Jev 在终端飞行模拟器里自动驾驶降落 — bilawalsidhu · 2026-09-25
- Greptile 助 NVIDIA 代码评审:合并时间从 24 小时降至 6 — ycombinator · 2026-09-25
- 开源 Claude Skill:一句话在 Blender 自动生成定格黏土动画短片 — angrypenguinPNG · 2026-09-25