斯坦福发布 Terminal-Bench-Science:70 项科学任务最强模型仅解出 30%

geoffwolfe · x · 2026-09-23

斯坦福团队联合全球科研机构发布 Terminal-Bench-Science 0.1,把 Terminal-Bench 的思路从软件工程扩展到科学研究领域。核心理念是:科学 agent 基准应由真正做科学的人来构建,而非模型厂商或数据供应商。

发布方 ReasonCore 还表示已有同类任务储备,可用于把真实科研流程转化为高难度的 agent 训练与评估任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →