斯坦福发布 Terminal-Bench-Science:70 项科学任务最强模型仅解出 30%
geoffwolfe · x · 2026-09-23
斯坦福团队联合全球科研机构发布 Terminal-Bench-Science 0.1,把 Terminal-Bench 的思路从软件工程扩展到科学研究领域。核心理念是:科学 agent 基准应由真正做科学的人来构建,而非模型厂商或数据供应商。
- 任务规模:从 920 份提案中仅收录 70 项任务,覆盖生命、物理、地球、数学与工程五大科学领域,涉及数据分析、仿真、证明、代码和数据产品等真实科研工作流。
- 可验证性:每项任务配有可复现的、任务特定的测试来进行打分。
- 持续演进:作为持续更新的基准,在科研需求与 AI 前沿之间形成反馈循环。
- 成绩:最强模型 Claude Opus 5 在 0.1 版本上的任务解决率仅为 30%,显示科学工作流对当前 agent 仍是巨大挑战。
发布方 ReasonCore 还表示已有同类任务储备,可用于把真实科研流程转化为高难度的 agent 训练与评估任务。
「编程与Agent」频道最新
- 把 Opus 5.5 拉满写 wildcard,它跑了 2 万次迭代只为不写错 a/an — mwoody450 · 2026-09-23
- 独行者用 MiniMax+Tripo+Blender 做出战斗短片,公开完整流程求指点 — Spoonman915 · 2026-09-23
- 微软 Agensh 论文:无中心编排扩到 1024 个智能体,通过率提升至 55% — andrew_n_carr · 2026-09-23
- 网传 GPT-6 可在浏览器操控 Paint 作画,演示引热议 — alexcovo_eth · 2026-09-23
- 双 Agent 并行开发实测:git 干净合并后测试全挂 — RunAI_Coder · 2026-09-23
- 手机拍照文本进电脑:OCR、视觉模型与 Agentic 流水线选择讨论 — silenceimpaired · 2026-09-23