ScholarCatalyst 基准:184 位作者标注的科研文献检索评测
Sohyeon Kim · hf · 2026-10-03
ScholarCatalyst 是一个检索 AI 能否像科学家一样找到关键先行文献的基准。
- 由 207 篇近期 CS 论文的 184 位第一作者标注:哪些候选论文确实或可能推动了他们的项目,并附详细理由
- 任务设定:给定最初研究问题,从项目开始时可得的文献中检索这些论文
- 结果:Agentic 搜索(0.42 Recall@20)并不优于嵌入检索(0.48);即便用可能在训练中见过这些论文的 Claude Fable 5.1 构建 agent,也只到 0.51
- 结论:模型缺乏科学家那种从海量文献中感知所需先验想法的直觉,需要新的训练方法
作者希望它成为科学 agent 研究的一步。
所属事件:ScholarCatalyst 基准发布:量化 AI 的研究品味(4 条相关)→
「研究」频道最新
- AC2 方法用 Critic 评 token 块,部分 rollout 训练快过 GRPO — ZeYanjie · 2026-10-03
- KAIST 推出 World Observer:全景观察者让世界模型看视野外世界 — Scobleizer · 2026-10-03
- Ofir Press 回应 bug 基准争议:训练该行为可取,但不许刷测试集 — OfirPress · 2026-10-03
- 中科院五年规划专章布局 AI for Science,中美路线大对决 — teortaxesTex · 2026-10-03
- 自动实验室标准草案浮现,AI 驱动科研或成下一个爆发点 — Afinetheorem · 2026-10-03
- 带 agent 的论文引用更多,AI 文献检索只看标题? — rajammanabrolu · 2026-10-03