Terminal-Bench-Science 使所有模型通过率降超10%

sanmikoyejo · x · 2026-08-28

Terminal-Bench-Science 在区分前沿模型方面与 Terminal-Bench 3.0 效果相当,但将所有评测模型的通过率拉低了超过 10 个百分点。具体数据:Opus 5 从 43% 降至 30%,GPT-5.6 Sol 从 34% 降至 22%,Fable 5 从 34% 降至 21%。这表明该基准任务对 AI 智能体具有更高的挑战性。

所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →