Stanford 发布 Terminal-Bench-Science:科研工作流 Agent 基准
BenBlaiszik · x · 2026-08-28
斯坦福主导的社区项目发布了 Terminal-Bench-Science,这是一个用于评估 AI 智能体在跨学科科研工作流中表现的新基准。
- 背景:由 Terminal-Bench 团队与全球科研机构专家合作构建。
- 规模:v0.1 版本包含 70 个任务。
- 表现:目前最强的 Claude Opus 5 也只能解决约 30% 的任务。
该基准旨在测试智能体处理实际科学研究流程(而不仅仅是回答问题)的能力。
所属事件:斯坦福发布科研 Agent 基准 Terminal-Bench-Science(11 条相关)→
「研究」频道最新
- DSPy.Flex 优化 Python 模块且减少 LLM 调用 — lateinteraction · 2026-08-28
- MIT 新框架 PottsMPNN 设计超出天然结构的蛋白质 — nordicinst · 2026-08-28
- 播客访谈:探讨 Python 开发工具手册及 Agent 时代博客价值 — tdhopper · 2026-08-28
- MIT 新框架 PottsMPNN 突破蛋白质设计瓶颈 — MIT News AI · 2026-08-28
- 关于模型“双盲”评估术语的歧义讨论 — BlancheMinerva · 2026-08-28
- DDP 精确断点恢复失败复盘:原子加、autotune 与桶布局三重坑 — ReinforcedKnowledge · 2026-08-28