Terminal-Bench-Science 使所有模型通过率降超10%
sanmikoyejo · x · 2026-08-28
Terminal-Bench-Science 在区分前沿模型方面与 Terminal-Bench 3.0 效果相当,但将所有评测模型的通过率拉低了超过 10 个百分点。具体数据:Opus 5 从 43% 降至 30%,GPT-5.6 Sol 从 34% 降至 22%,Fable 5 从 34% 降至 21%。这表明该基准任务对 AI 智能体具有更高的挑战性。
所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→
「研究」频道最新
- Sai 登顶 OSWorld 2.0,成本仅对手 2/3 — taoyds · 2026-08-28
- Factory 推出 ProgramBench:从零复现软件的基准 — matanSF · 2026-08-28
- 消融讨论:query 头数前两阶段几乎无影响,稀疏路由需训练 — stochasticchasm · 2026-08-28
- 404 团队将讲解 Titan 模型与世界模型 — markjeffrey · 2026-08-28
- 英伟达详解 QAD 优化模型性能流程 — PyTorch · 2026-08-28
- 研究:代码 AI 正改变 PR 词汇风格 — ycombinator · 2026-08-28