发布 BrowseComp-Plus 评测基准,构建深度研究评估新标

lintool · x · 2026-08-22

Castorini 推出 BrowseComp-Plus,这是一个用于评估深度研究 Agent 的新基准。它基于 5.53 亿文档的 ClimbMix-400B 语料库构建,包含人工验证的正例和网页挖掘的困难负例。该基准旨在更公平、透明地评估深度研究系统组件(如 GPT-5 + Qwen3-Embedding)的性能,目前已在 GitHub 开源代码与数据。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →