920 项提案仅 70 项入选 Terminal-Bench-Science
sanmikoyejo · x · 2026-08-28
任务通过公开评审流程由全球研究人员贡献。每个任务需经过三层评审:领域评审员、技术评审员和标准把关人(Bar Raiser)。从 920 项提案中,最终 70 项任务入选 Terminal-Bench-Science 0.1。入选任务必须具备科学依据、客观可验证性,并对前沿智能体构成真正的挑战。
所属事件:斯坦福发布科研智能体基准 Terminal-Bench-Science(17 条相关)→
「研究」频道最新
- Sai 登顶 OSWorld 2.0,成本仅对手 2/3 — taoyds · 2026-08-28
- Factory 推出 ProgramBench:从零复现软件的基准 — matanSF · 2026-08-28
- 消融讨论:query 头数前两阶段几乎无影响,稀疏路由需训练 — stochasticchasm · 2026-08-28
- 404 团队将讲解 Titan 模型与世界模型 — markjeffrey · 2026-08-28
- 英伟达详解 QAD 优化模型性能流程 — PyTorch · 2026-08-28
- 研究:代码 AI 正改变 PR 词汇风格 — ycombinator · 2026-08-28