Terminal-Bench 推出科学版基准,征集科研工作流测试 AI 智能体

heyneighbor · x · 2026-08-05

Terminal-Bench 宣布推出 Terminal-Bench Science,这是一个旨在评估 AI 智能体在自然科学领域真实计算工作流表现的基准测试。

现有的 AI for Science 基准大多只测试教科书知识,而新基准将直接采用来自实验室的真实科研工作流,并在容器化环境中进行程序化验证。该项目鼓励科学家们将各自的科研流程转化为测试任务,以帮助前沿 AI 实验室(如 Anthropic、OpenAI 和 Google DeepMind)评估并改进其智能体的科研能力,最终反哺科研界。

任务的 PR 提交截止日期为 2026 年 8 月 17 日。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →