发布 BrowseComp-Plus 评测基准,构建深度研究评估新标
lintool · x · 2026-08-22
Castorini 推出 BrowseComp-Plus,这是一个用于评估深度研究 Agent 的新基准。它基于 5.53 亿文档的 ClimbMix-400B 语料库构建,包含人工验证的正例和网页挖掘的困难负例。该基准旨在更公平、透明地评估深度研究系统组件(如 GPT-5 + Qwen3-Embedding)的性能,目前已在 GitHub 开源代码与数据。
「研究」频道最新
- Equilibrium Forcing:无需噪声条件的自适应视频生成 — kwangmoo_yi · 2026-08-22
- 新方法 Equilibrium Forcing 实现视频生成的自适应噪声估计 — kwangmoo_yi · 2026-08-22
- 深度播客:世界模型如何解锁物理 AI 与机器人技术 — risingodegua · 2026-08-22
- OpenBind 发布:基于 OpenFold3 的小分子共折叠模型 — MoAlQuraishi · 2026-08-22
- 新研究用 LLM 代码生成驱动进化算法,自创专家 API — kenneth0stanley · 2026-08-22
- Yukon 排行榜更新:改按总贡献速度比排名 — morgymcg · 2026-08-22