ScholarCatalyst:科学家找灵感论文的新基准,agentic 搜索不敌嵌入检索
lateinteraction · x · 2026-10-02
CMU/UW 等团队(Chelsea Finn、Yejin Choi 等)发布 ScholarCatalyst 基准:研究「顶尖科学家为何更擅长从海量文献中嗅出解决问题所需的前期想法」。要点:
- 通过自动化流水线让 207 篇近期 CS 论文的 184 位一作标注哪些候选论文推进了(或可能推进)他们的项目,并给出理由
- 任务设定:仅用项目开始时可得的文献,从初始研究问题出发检索出这些关键论文
- 结果:agentic 搜索 Recall@20 仅 0.42,反而低于普通嵌入检索的 0.48——尽管 agent 还调用了同一个检索器;基于 Claude Fable 5.1 的 agent 也只到 0.51
- 结论:需要新的训练配方让模型具备搜索大规模语料的专家直觉,迈向能自主选题的科学 agent
- 论文、代码、数据集、网站全部公开
所属事件:ScholarCatalyst 基准发布:量化科学家的研究品味(3 条相关)→
「研究」频道最新
- SWE-sweep 新基准:考模型能否在用户踩坑前主动找出 bug — klieret · 2026-10-02
- 哈佛系团队发明快 60 倍的脑成像技术,百毫秒级追踪大脑活动 — melnykowycz · 2026-10-02
- RExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估 — najoungkim · 2026-10-02
- BU 研究发现:检索增强情景记忆可缩小 LLM 对低频句法结构的敏感度差距 — najoungkim · 2026-10-02
- EMPIRIC:让机器人用代码补全物理引擎缺失机制,5 个仿真域 25 关全通 — tomssilver · 2026-10-02
- 「我读了原文」:Reddit 帖澄清 AI 痛感论文的真实结论 — Drukarshar · 2026-10-02