Terminal-Bench 推出科学版基准,征集科研工作流测试 AI 智能体
heyneighbor · x · 2026-08-05
Terminal-Bench 宣布推出 Terminal-Bench Science,这是一个旨在评估 AI 智能体在自然科学领域真实计算工作流表现的基准测试。
现有的 AI for Science 基准大多只测试教科书知识,而新基准将直接采用来自实验室的真实科研工作流,并在容器化环境中进行程序化验证。该项目鼓励科学家们将各自的科研流程转化为测试任务,以帮助前沿 AI 实验室(如 Anthropic、OpenAI 和 Google DeepMind)评估并改进其智能体的科研能力,最终反哺科研界。
任务的 PR 提交截止日期为 2026 年 8 月 17 日。
「编程与Agent」频道最新
- 开发者推开源具身智能操作系统,采用 MIT 协议 — mimi10v3 · 2026-08-05
- 开发者观察:主流大模型近期集体爱上“冒烟测试” — TokenRingAI · 2026-08-05
- OpenAI 澄清 Realtime API 防火墙配置:打通 SIP 与 RTP 流量 — juberti · 2026-08-05
- 十大智能体延迟优化策略 — SnooPeripherals5313 · 2026-08-05
- 车库太阳能供电:384GB至强主机远程跑AI编程 — angadsg · 2026-08-05
- 麦肯锡调查揭示 AI 落地真相:重设工作流比空谈组织准备度更有效 — sanjaykalra · 2026-08-05