Terminal-Bench-Science 发布:Claude Opus 5 仅解约 30% 科研任务
BenBlaiszik · x · 2026-08-28
Stanford 牵头的社区项目发布 Terminal-Bench-Science:一个评估 AI agent 在跨学科科研工作流上表现的基准,v0.1 含 70 个任务,由 Terminal-Bench 团队与全球科研机构领域专家共建。
亮点结果:Claude Opus 5 仅解决约 30% 的任务。其中计算化学方向的 X 射线衍射物相分析任务(全球数千化学家的日常工作)中,最强前沿模型在最大努力模式下鏖战数小时,最终仍无法达到专家科学判断的门槛。团队期望该基准推动模型在前沿科学上的能力提升。
所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→
「研究」频道最新
- Sai 登顶 OSWorld 2.0,成本仅对手 2/3 — taoyds · 2026-08-28
- Factory 推出 ProgramBench:从零复现软件的基准 — matanSF · 2026-08-28
- 消融讨论:query 头数前两阶段几乎无影响,稀疏路由需训练 — stochasticchasm · 2026-08-28
- 404 团队将讲解 Titan 模型与世界模型 — markjeffrey · 2026-08-28
- 英伟达详解 QAD 优化模型性能流程 — PyTorch · 2026-08-28
- 研究:代码 AI 正改变 PR 词汇风格 — ycombinator · 2026-08-28