TerminalBench-Science 发布:Opus 5 通过率 30%
BenBlaiszik · x · 2026-08-28
TerminalBench-Science v0.1 正式发布,这是一个由科学家构建、旨在评估 Agent 在科学任务中表现的新基准。初始结果显示,在纯通过率上,Claude Opus 5 (Claude Code) 以 30.0% 领先,其次是 GPT-5.6 Sol (Codex) 的 22.4% 和 Claude Fable 5 的 21.4%。在成本与任务解决率的帕累托前沿上,GPT 5.6 变体和 Opus 5 表现最佳。
所属事件:斯坦福发布科研基准 TBS,Opus 5 通过率仅30%(14 条相关)→
「研究」频道最新
- 小规模复现大模型训练不稳定:学习率敏感度研究 — stochasticchasm · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — BlancheMinerva · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — BlancheMinerva · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — iamtrask · 2026-08-28
- 探讨 Claude 意识、思维链与对齐机制的可解释性 — ChengleiSi · 2026-08-28
- 开发者分享各自的 NS 迭代训练配置 — stochasticchasm · 2026-08-28