斯坦福发布科研智能体基准 TB-Science,Claude Opus 5 仅过 30%
ajratner · x · 2026-08-28
斯坦福牵头发布 Terminal-Bench-Science:评估 AI 智能体在物理、生命、地球、数学等科学领域真实计算工作流上表现的基准,由 Terminal-Bench 团队与全球科研机构领域专家共建。
v0.1 包含 70 个任务,当前最强的 Claude Opus 5 仅解决约 30%,对前沿模型相当难。任务源自真实科研计算流程,经多阶段专家评审把关。Snorkel AI 通过 Open Benchmarks Grants 计划参与合作,Laude Institute、Harbor 等团队参与建设。
所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→
「编程与Agent」频道最新
- 研究:代码 AI 正改变 PR 词汇风格 — ycombinator · 2026-08-28
- 调研显示72%开发者愿为5倍速度牺牲20%智能 — sonic_op · 2026-08-28
- 观点:收购 Cursor 或是马斯克明智之举 — prasenx · 2026-08-28
- Artie 全团队用 Hermes AI 智能体:销售、设计、工程各有定制版 — Teknium · 2026-08-28
- Ramp 推出 Agent 支付功能,支持发票与记账 — kleffew94 · 2026-08-28
- 逆向苹果笔记 API,开发者打造全能 CLI 工具 — rudrank · 2026-08-28