斯坦福发布科研工作流基准,Claude 仅解 30%
BenBlaiszik · x · 2026-08-28
斯坦福主导的社区项目 Terminal-Bench-Science (v0.1) 正式发布,这是一个评估 AI 智能体在生命、物理、数学等领域科研工作流能力的基准。目前包含 70 个基于真实计算流程的任务,并经过多阶段专家审查。测试显示,即使是 Claude Opus 5 也仅能解决约 30% 的任务。
所属事件:斯坦福发布科研基准 TBS,Opus 5 通过率仅30%(14 条相关)→
「编程与Agent」频道最新
- 谷歌云推 Cloud Run 实例,5.7 美元/月运行长时 Agent — IanAndrewsDC · 2026-08-28
- 观点:模型与 Harness 相辅相成,工程能力是未来关键 — omarsar0 · 2026-08-28
- 斯坦福发布科研智能体基准 TB-Science,Claude Opus 5 仅过 30% — ajratner · 2026-08-28
- Harness 层不该是黑盒:开源框架让 agent 定制更容易 — omarsar0 · 2026-08-28
- 开发者观点:所谓 Agent 只是换皮 Prompt,并非新生命 — gerardsans · 2026-08-28
- 观点:应拒绝黑盒 Harness 配置,拥抱开源可定制方案 — omarsar0 · 2026-08-28