用3D游戏评测模型世界理解
sebnadeau · reddit · 2026-07-15
作者搭建了 WorldBuild Bench,用可玩的 3D 游戏来评测不同模型在“世界模型”层面的能力。
他认为,静态题目很难衡量模型对空间、时间和因果关系的理解,因此改用三类 3D 游戏任务来测试:
- 竞技场战斗游戏
- 物理谜题
- 赛车游戏
首轮一共测试了 8 个模型,生成了 24 个浏览器可玩的 3D 游戏。作者强调,评估重点不是传统分数,而是更贴近真实体验的维度:空间一致性、时间一致性、因果一致性、画面表现和完整度。
方法上,项目采用盲测的双游戏对比:用户在不知道模型名字的情况下玩两款同 brief 生成的游戏,再从整体偏好、手感、世界设计、呈现和完整性上做比较。作者还公开了生成时间、成本、代码量和底层产物,并认为这些信息比单纯的 benchmark 分数更有参考价值。
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11