BrowseComp-Plus 评测深度研究 Agent,生产系统只需约 9 轮
IgorCarron · x · 2026-07-22
BrowseComp-Plus 用于公平评测深度检索 Agent
这条介绍了一个新的深度研究评测基准 BrowseComp-Plus,目标是给 deep-research 系统做更公平、解耦的评测。
它建立在 BrowseComp 之上,使用一套精心整理的网页文档语料,其中包含人工验证的正例和挖掘出来的困难负例。
基准重点想分开评估两类东西:
- LLM Agent 在同一检索环境下的表现
- Retriever 在端到端 deep-research 中的真实贡献,而不是只看代理检索指标
配图还展示了 LightOn Console 的成绩:在某个设置里,它作为生产系统进入了 Top 5,平均大约只需要 9 轮,而榜首研究方案要 209 轮 左右,效率差距很大。
这条传达的核心信息是:生产系统不一定只是“能用”,也可能比榜单顶端实验方案便宜得多、快得多。
「研究」频道最新
- 自进化 Lean 证明代理靠基准共演化,miniF2F 达到 45.1% — omarsar0 · 2026-07-22
- 金融图表 AI 发现温度设为 0 还不够,整条链都要确定性 — famelebg29 · 2026-07-22
- 机器人论文:稠密 patch 特征胜过更大的视觉语言模型 — stepjamUK · 2026-07-22
- Meta 的 GAMUT 基准显示模型仍常漏掉关键信息 — dair_ai · 2026-07-22
- 新论文把智能与可学习新颖性联系起来 — theomitsa · 2026-07-22
- Turing Motors 称 CTO 斩获 Kaggle 2026 ARC-AGI 竞赛金牌 — MeganRisdal · 2026-07-22