斯坦福发布科研智能体基准 TB-Science,Claude Opus 5 仅过 30%

ajratner · x · 2026-08-28

斯坦福牵头发布 Terminal-Bench-Science:评估 AI 智能体在物理、生命、地球、数学等科学领域真实计算工作流上表现的基准,由 Terminal-Bench 团队与全球科研机构领域专家共建。

v0.1 包含 70 个任务,当前最强的 Claude Opus 5 仅解决约 30%,对前沿模型相当难。任务源自真实科研计算流程,经多阶段专家评审把关。Snorkel AI 通过 Open Benchmarks Grants 计划参与合作,Laude Institute、Harbor 等团队参与建设。

所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →