Terminal-Bench-Science:科学终端能力评测基准发布
BenBlaiszik · x · 2026-08-28
作者分享了 Terminal-Bench-Science 项目的链接。这是一个专注于评测 AI 模型在科学计算终端环境操作能力的基准测试工具。
所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→
「研究」频道最新
- Sai 登顶 OSWorld 2.0,成本仅对手 2/3 — taoyds · 2026-08-28
- Factory 推出 ProgramBench:从零复现软件的基准 — matanSF · 2026-08-28
- 消融讨论:query 头数前两阶段几乎无影响,稀疏路由需训练 — stochasticchasm · 2026-08-28
- 404 团队将讲解 Titan 模型与世界模型 — markjeffrey · 2026-08-28
- 英伟达详解 QAD 优化模型性能流程 — PyTorch · 2026-08-28
- 研究:代码 AI 正改变 PR 词汇风格 — ycombinator · 2026-08-28