SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍
mariyaivasileva · x · 2026-09-04
PatronusAI 发布 SpeedrunBench,首个衡量智能体「多快能通关」而非仅能否通关视频游戏的基准,覆盖《马里奥赛车》《宝可梦蓝》等 10 款游戏。
结果呈两极:在较简单的游戏上,前沿模型已接近人类世界纪录;但在《宝可梦蓝》这类复杂游戏上,最强模型 Kimi-K3 和 Opus 5 的速通时间仍落后世界纪录约 4 倍。基准、论文与 demo 一并公开。
「模型」频道最新
- OpenAI 称 GPT-6 Astra 登顶 FrontierMath Tier 4、ARC-AGI 3 等多项最难基准 — dair_ai · 2026-09-04
- 48 小时内连发五款:GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash 齐至 — dr_cintas · 2026-09-04
- Astra 仍只是 PR 发布,复杂工作负载正流向 Fable 5.1 — bindureddy · 2026-09-04
- theo 盛赞 GPT-6 Astra:不只是代码模型,是一代人的能力跃迁 — gabrielchua · 2026-09-04
- Chollet:ARC-AGI-3被攻破速度比预期快一倍 — fchollet · 2026-09-04
- 多款旗舰模型实测:仅凭照片重建 Geisel 图书馆 3D,差距悬殊 — Lianhuiq · 2026-09-04