DeepScholar-Bench:用实时 ArXiv 论文评测 AI 研究综述能力
berkeley_ai · x · 2026-10-06
UC Berkeley 团队(Liana Patel、Ion Stoica、Matei Zaharia、Carlos Guestrin 等)发布 DeepScholar-Bench,将在 COLM 2026 上介绍。这是一个针对「生成式研究综述」系统的动态基准与自动化评测框架。
- 任务设定:让 AI 系统从实时网络检索、综合并引用已有工作,生成一篇 related work 长文报告,而非简单的事实问答。
- 数据来源:查询与人类范文均取自最新高质量 ArXiv 论文,避免专家数据集的过时与数据污染问题。
- 评测维度:知识综合、检索质量、可验证性三方面整体打分。
- 附带贡献:开源参考管线 DeepScholar-ref,基于 LOTUS 框架实现,可作为强基线。
作者 Negar Arabzadeh 还将在终身智能体工作坊展示另一篇 Multi-Agent Transactive Memory 论文,并欢迎现场交流 search agents 与 deep research 系统。
「编程与Agent」频道最新
- Jev 模型玩法清单:MCP 路由、上下文清理与浏览器 Agent — blaizedsouza · 2026-10-06
- 用 Opus 5.5 画篆书「宝玉」印章:完整提示词公开 — dotey · 2026-10-06
- 十万粉开发者感叹:编程如今就是对着电脑说话 — KevinNaughtonJr · 2026-10-06
- Reason 发布 1.0:主打自定义模型接入的前沿编码 agent — kalyan_kpl · 2026-10-06
- COLM 2026 论文 SkillFoundry:从异构科学资源自进化 Agent 技能库 — jmuiuc · 2026-10-06
- 200 行 PyTorch 实现迷你蛋白质折叠预测器,演示 flow matching — CatAstro_Piyush · 2026-10-06