Terminal-Bench-Science 发布:Claude Opus 5 仅解约 30% 科研任务

BenBlaiszik · x · 2026-08-28

Stanford 牵头的社区项目发布 Terminal-Bench-Science:一个评估 AI agent 在跨学科科研工作流上表现的基准,v0.1 含 70 个任务,由 Terminal-Bench 团队与全球科研机构领域专家共建。

亮点结果:Claude Opus 5 仅解决约 30% 的任务。其中计算化学方向的 X 射线衍射物相分析任务(全球数千化学家的日常工作)中,最强前沿模型在最大努力模式下鏖战数小时,最终仍无法达到专家科学判断的门槛。团队期望该基准推动模型在前沿科学上的能力提升。

所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →