斯坦福发布科研基准 TBS,Opus 5 通过率仅30%
斯坦福主导的 Terminal-Bench 团队联合全球多所顶尖高校发布 Terminal-Bench-Science (TBS) v0.1,一个评估 AI 智能体跨学科科研工作流能力的新基准。当前最强模型 Claude Opus 5 通过率仅 30.0%,显示前沿模型与真正的科研自动化之间仍有巨大差距,该基准为追踪科学工作流自动化进展提供了新标尺。
已确认
- v0.1 包含 70 个任务,覆盖生命科学、物理、数学、工程和地球科学,基于真实计算流程构建,并经多阶段专家审查
- 综合通过率上 Claude Opus 5 (Claude Code) 以 30.0% 领先 GPT-5.6 Sol;分领域看,数学领域 GPT-5.6 Sol 以 31.4% 胜出
- 任务从 920 个提案中筛选出 70 个,每个任务需经过领域评审员、技术评审员和 Bar Raiser(标准把关人)三层评审,作者估计单个任务构建耗时超过 80 小时
- 与 Terminal-Bench 3.0 相比,TBS 在区分前沿模型方面效果相当,但将所有模型通过率拉低超过 10 个百分点(如 Opus 5 从 43% 降至 30%;相同模型在 Terminal-Bench 3.0 上得分显著更高,如 Fable 5 达 83.8%),难度针对最新前沿模型专门校准
- 参与共建的机构包括斯坦福、MIT、普林斯顿、清华、北大、牛津、剑桥等,项目由 Terminal-Bench 和 Harbor Framework 团队主导;还拥有庞大的评审团队、科学顾问与来自各大 AI 实验室的 AI 研究顾问,并公开致谢
- 项目定位:填补科研能力测量空白,通过测试智能体在多学科科研工作流中的表现,追踪实现“十年百年进步”所需的前提能力(BenBlaiszik 转述相关评论观点)
为什么重要
- 加速科学工作流被视为推动人类发展的最大杠杆,此前缺少专门测量该能力的基准,TBS 为社区提供了可追踪的标尺
- 难度针对最新前沿模型校准且区分度与既有基准相当,能有效衡量未来模型的科研能力进展
- 任务由全球研究人员经公开评审流程贡献,严苛筛选保证了基准质量与抗饱和能力
2026-08-28 ~ 2026-08-28 · 14 条相关
一手来源
- TerminalBench-Science v0.1:Opus 5 综合领先 — BenBlaiszik ·
- TerminalBench-Science 严苛筛选:920 提案仅 70 入选 — BenBlaiszik ·
- Terminal-Bench-Science 使所有模型通过率降超10% — sanmikoyejo ·
- Stanford 发布 Terminal-Bench-Science:科研工作流 Agent 基准 — BenBlaiszik · 2026-08-28
- TerminalBench-Science 发布:Opus 5 通过率 30% — BenBlaiszik · 2026-08-28
- 【源头】TerminalBench-Science 严苛筛选:920 提案仅 70 入选 — BenBlaiszik · 2026-08-28
- TerminalBench-Science 难度极高:模型分数大幅下降 — BenBlaiszik · 2026-08-28
- 【源头】TerminalBench-Science v0.1:Opus 5 综合领先 — BenBlaiszik · 2026-08-28
- TerminalBench-Science 感谢庞大评审与顾问团队 — BenBlaiszik · 2026-08-28
- Terminal-Bench-Science 旨在填补科研能力测量空白 — BenBlaiszik · 2026-08-28
- 斯坦福发布科研工作流基准,Claude 仅解 30% — BenBlaiszik · 2026-08-28
- Terminal-Bench-Science 0.1 发布 70 个跨学科科研任务 — sanmikoyejo · 2026-08-28
- 920 项提案仅 70 项入选 Terminal-Bench-Science — sanmikoyejo · 2026-08-28
- 【源头】Terminal-Bench-Science 使所有模型通过率降超10% — sanmikoyejo · 2026-08-28
- Terminal-Bench 汇聚全球顶尖高校科学家共建 — sanmikoyejo · 2026-08-28
- Terminal-Bench-Science 发布:Claude Opus 5 仅解约 30% 科研任务 — BenBlaiszik · 2026-08-28
- Terminal-Bench-Science:科学终端能力评测基准发布 — BenBlaiszik · 2026-08-28