Arena 推出 GameDevBench:用真实教程构建可验证游戏开发基准
arena · x · 2026-09-10
LMArena 官方账号介绍了由 CMU 博士生、Arena 研究实习生 Wayne Chi 打造的 GameDevBench:该基准从真实游戏开发教程构建,把游戏开发任务转化为可验证、确定性的评测项。
- 核心问题:前沿模型在人类新手 1 小时内能完成的任务上表现如何?最大瓶颈究竟是代码能力还是多模态理解?
- 游戏开发是 Arena 上被请求最多、也最具挑战性的类别之一;完整结果与讲解见 Wayne Chi 的演讲视频。
「研究」频道最新
- 新基准 VDiff-Bench:1756 题暴露前沿模型找不同能力短板 — yixin_wan_ · 2026-09-10
- AutoResearchExam 用隐藏测试集观察 AI 做 24 小时科研的真实行为 — AlexGDimakis · 2026-09-10
- Goodfire 提出「预测性数据调试」,训练前预判 LLM 行为变化 — leland_mcinnes · 2026-09-10
- OpenAI 宣称解决纳维-斯托克斯问题,却没登上任何头条 — IgorCarron · 2026-09-10
- Michael Levin 新论文:以结构化潜空间刻画新形态的生命与心智 — danfaggella · 2026-09-10
- 研究显示「末日论者预测更准」或只是流言:XPT 锦标赛复盘 — random_walker · 2026-09-10