TerminalBench-Science v0.1:Opus 5 综合领先
BenBlaiszik · x · 2026-08-28
TerminalBench-Science v0.1 包含 70 个任务,涵盖生命、物理、数学、工程和地球科学。在通过率方面,Claude Opus 5 领先 GPT-5.6 Sol,但在数学领域 Sol 以 31.4% 胜出。项目旨在建立科学家贡献、Agent 提升、发现加速的良性循环,目前仍在持续接受任务贡献。
所属事件:斯坦福发布科研基准 TBS,Opus 5 通过率仅30%(14 条相关)→
「研究」频道最新
- 斯坦福发布科研智能体基准 TB-Science,Claude Opus 5 仅过 30% — ajratner · 2026-08-28
- 分享一张极其清晰的 GDN 架构图 — stochasticchasm · 2026-08-28
- Terminal-Bench-Science 细节:定义下一代科学编码 Agent — ajratner · 2026-08-28
- 研究称密集奖励能突破后训练天花板,稀疏奖励失效 — joecole · 2026-08-28
- 小规模复现大模型训练不稳定:学习率敏感度研究 — stochasticchasm · 2026-08-28
- MLC 模型评估是否算双盲实验?业界存疑 — BlancheMinerva · 2026-08-28