Terminal-Bench 扩展到科学工作流

StanfordAILab · x · 2026-07-13

Stanford AI Lab 转发宣布 Terminal-Bench Science:把原本用于编码任务的 Terminal-Bench 扩展到真实科学工作流的 AI agent 评测。

项目目前开放任务贡献,目标是更系统地衡量 agent 在科学场景中的表现,而不是只看代码题上的能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →