BrowseComp-Plus 评测深度研究 Agent,生产系统只需约 9 轮

IgorCarron · x · 2026-07-22

BrowseComp-Plus 用于公平评测深度检索 Agent

这条介绍了一个新的深度研究评测基准 BrowseComp-Plus,目标是给 deep-research 系统做更公平、解耦的评测。

它建立在 BrowseComp 之上,使用一套精心整理的网页文档语料,其中包含人工验证的正例和挖掘出来的困难负例。

基准重点想分开评估两类东西:

配图还展示了 LightOn Console 的成绩:在某个设置里,它作为生产系统进入了 Top 5,平均大约只需要 9 轮,而榜首研究方案要 209 轮 左右,效率差距很大。

这条传达的核心信息是:生产系统不一定只是“能用”,也可能比榜单顶端实验方案便宜得多、快得多。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →