研究论文: Sol 5.6 不用搜索工具答对 46% 测试题
beirmug · x · 2026-08-28
Sahel Sharify 等人发表论文《Projecting BrowseComp-Plus onto ClimbMix》,探讨了代理搜索基准的真实性。
研究背景:
- 原始 BrowseComp-Plus 基准使用约 10 万篇文档的固定语料库,但这些文档是为特定查询构建的,缺乏真实世界的噪声和复杂性。
- 新研究将问题投影到 NVIDIA ClimbMix (400B token, 553M 文档) 这一真实通用语料库中,通过“原子推理跳”(atomic reasoning hops) 分解和验证来确保证据存在。
关键发现:
- 论文数据显示,Sol 5.6 模型仅凭参数化知识(不使用搜索工具)在原 BrowseComp-Plus 上即可达到 46.1% 的原生正确率。
- 投影到 ClimbMix 后,检索难度显著增加,最强代理的得分下降了 5 个百分点,这更真实地反映了现实中的检索挑战。
所属事件:研究称搜索Agent依赖工具 非英语查询性能骤降(2 条相关)→
「研究」频道最新
- NeurIPS Sim2Science 工作坊延期至 2026 年 9 月 2 日 — _rdgao · 2026-08-29
- 南洋理工发布 ACE-Data-0:150 小时全模态同步具身数据集 — liuziwei7 · 2026-08-29
- KAIST 推出 K-Fold 生物 AI,推理速度宣称快 25 倍 — AllThingsApx · 2026-08-29
- 迪卡侬弃用 DeepAR,转用 Chronos-2 实现大规模需求预测 — AWS ML Blog · 2026-08-29
- 观点:优化语言压缩造就了今天的 LLM — kuchaev · 2026-08-29
- 新理论:衰老始于细胞完成发育后失去共同目标 — rand_longevity · 2026-08-29