TerminalBench-Science 发布:Opus 5 通过率 30%

BenBlaiszik · x · 2026-08-28

TerminalBench-Science v0.1 正式发布,这是一个由科学家构建、旨在评估 Agent 在科学任务中表现的新基准。初始结果显示,在纯通过率上,Claude Opus 5 (Claude Code) 以 30.0% 领先,其次是 GPT-5.6 Sol (Codex) 的 22.4% 和 Claude Fable 5 的 21.4%。在成本与任务解决率的帕累托前沿上,GPT 5.6 变体和 Opus 5 表现最佳。

所属事件:斯坦福发布科研基准 TBS,Opus 5 通过率仅30%(14 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →