TerminalBench-Science 难度极高:模型分数大幅下降

BenBlaiszik · x · 2026-08-28

对比显示,相同模型在 Terminal-Bench 3.0 上得分显著更高(Fable 5: 83.8%),而 TerminalBench-Science (TBS) 将所有模型分数压低了 10 分以上。这种难度是针对最新前沿模型专门校准的。项目筛选门槛极高,从 920 个提案中仅选出 70 个任务,每个任务耗时不菲。

所属事件:斯坦福发布科研基准 TBS,Opus 5 通过率仅30%(14 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →