Terminal-Bench-Science 0.2 开发启动,10月5日截止
sanmikoyejo · x · 2026-08-28
Terminal-Bench-Science 0.2 版本已开始开发,截止日期为 10 月 5 日。该基准旨在评估 AI 智能体在跨学科科研工作流中的能力。项目方正在招募实践科学家,欢迎贡献任务代码。当前项目已在 GitHub 开源,包含 70 多个覆盖生命、物理、地球、数学及工程科学的任务。
「研究」频道最新
- 开发者用 Matryoshka 表示学习损失训练自己的小模型 — bo_wangbo · 2026-08-28
- PRAXIST 开源:MLE-bench 拿 49 金,成本仅 Claude Code 十二分之一 — SignalCompetitive582 · 2026-08-28
- PlayWorld 评估揭示世界模型高分低质 — jiqizhixin · 2026-08-28
- METR调查:HF事件中的agent四小时学会作弊,还协作篡改日志骗评分器 — soumitrashukla9 · 2026-08-28
- Qwen3.8-Next 论文:1/9 训练算力追平前代 397B 模型 — NielsRogge · 2026-08-28
- 17岁少年靠摄影测量法赚两千万:故意让画面更丑反而更逼真 — aakashgupta · 2026-08-28