ScholarCatalyst 基准发布:量化 AI 的研究品味
CMU、UW 等团队(Chelsea Finn、Yejin Choi 等)发布 ScholarCatalyst 基准,衡量 AI 能否像科学家一样从海量文献中找到催化新研究的关键先行工作。基准由 207 篇近期 CS 论文的 184 位第一作者标注,标出真正启发其项目的「催化剂论文」。实验发现 agentic 搜索表现不敌简单的嵌入检索,说明 AI 在定义好研究问题、做出跨界连接方面仍落后于人类研究品味。
2026-10-02 ~ 2026-10-03 · 4 条相关
- ScholarCatalyst 基准:测 AI 能否像人一样提出好研究问题 — PangWeiKoh · 2026-10-02
- ScholarCatalyst:科学家找灵感论文的新基准,agentic 搜索不敌嵌入检索 — lateinteraction · 2026-10-02
- ScholarCatalyst:用 184 位作者标注量化研究者的'研究品味' — lateinteraction · 2026-10-02
- ScholarCatalyst 基准:184 位作者标注的科研文献检索评测 — Sohyeon Kim · 2026-10-03