ScholarCatalyst 基准:前沿模型难辨哪篇旧论文能启发新研究
CatAstro_Piyush · x · 2026-10-05
Stanford、CMU、MIT 等机构推出 ScholarCatalyst——衡量 AI 能否像科学家一样判断哪些已有研究能真正推进一个新课题的检索基准。
- 数据构建:请 207 篇近期 CS 论文的 184 位一作/主导作者标注哪些候选论文「实际或可能」推进过他们的项目,并给出详细理由,再由自动化流水线扩展标注规模。
- 任务设定:给定研究初始问题,从项目开始时可获得的文献中检索出这些「灵感论文」。
- 关键结果:基于 Claude Fable 5.1 的 agentic search 仅达 0.51 Recall@20,不比纯 embedding 检索(0.48)好多少,即便它调用了同一个检索器作为工具——即使模型可能在训练中见过这些论文也如此。
- 结论:识别「哪篇旧研究对新问题有用」仍是模型的短板,需要新的训练方法来注入这种科学家直觉;作者希望它成为科学 agent 的垫脚石。
「研究」频道最新
- MoralityBench 榜单:AI 的道德判断跨次运行波动大,并非确定性输出 — NakedPlato · 2026-10-05
- 基因组学家说 AI 是世界模型,药物化学家说它只是流程编排器 — shyamalanadkat · 2026-10-05
- 斯坦福学者论战组学图谱:单独没用,配 AI 模型才能挖出生物学 — anshulkundaje · 2026-10-05
- 25 年语义工程老将提出 Ontology Pipeline:AI 时代的语义基础设施框架 — adnan_hashmi · 2026-10-05
- 12 封拿破仑时代密电被破译:密码本按字母序排列成破局关键 — apples_jimmy · 2026-10-05
- 「轮廓谬误」:仿神经元结构不等于继承其计算能力 — neurovium · 2026-10-05