编码智能体写得出可玩游戏,GameXpert测出自己找缺陷仍远

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

cs.AI, cs.CL

2026-08-22

腾讯用97个空白生成、每关19到27个注入缺陷的100个修复任务、17条六轮优化链评编码智能体:能铺可玩骨架,难自己发现缺陷,也难保证改完还能玩。

这篇在解决什么

编码智能体已经能从一句自然语言、在空仓库里做出浏览器游戏。难处在于,逻辑、画面、交互和可玩性必须焊进同一个可执行产物。现有基准大多只看最终产物,或只切生成、修缺陷、迭代里的一段。一次能编译、一张截图像样,并不等于能玩、能改、改完还不把核心循环弄坏。

腾讯混元团队和 Lightspeed Studios 从完整的人机共创轨迹里做定性编码,把会改动产物的交互归成三类:初次生成、缺陷诊断与修复、多轮产品向优化。GameXpert-Bench 把这三类做成三条互补赛道,评分一律落到可执行游戏的行为上。代码写了但运行触发不了,不算分。

方法

GameGen 给 97 个设计简报,覆盖 11 个类型,其中 44 个要 3D。智能体从空白工作区单次生成浏览器游戏,不给模板、素材,也不指定引擎。评测先用跨模型事件分析做出共享量规,再拆成完备性(核心事件)、丰富度(加分事件)、视觉质量和玩家体验四维,各占四分之一。前两维要静态看代码,再进运行时交互验证;后两维由人评。

GameFix 用 50 个内部金标关卡,每关一次性注入 19 到 27 个可逆缺陷,覆盖玩法、成长、UI、美术、运行时、关卡和数值七个维度、61 个子类。同一关卡跑两种提问:把全部异常列成清单(Explicit Issue),或只透露主观观感、客观缺陷要自己找(Self-Discovery)。评分走 Playwright 无头浏览器,Fail-to-Pass 确认修好,Pass-to-Pass 确认没回归。主指标 Strict 看任务分落在 90 到 100 区间的存活曲线高度。Cliff 是清单模式到自发现模式的分数落差。

GameOpt 用 17 个 JavaScript 游戏、每条六轮、共 102 条请求,维度覆盖玩法、关卡、数值、美术、界面和音频。仓库不重置,后一轮吃自己上一轮的产物。701 条验收里 604 条正向、97 条回归;最终分是难度偏向的加权通过率再扣回归。

结果

GameGen 上 Claude-Opus-5 总分 79.7,完备性 94.4,丰富度只有 72.0。15 个模型的完备性均值 77.5,丰富度均值 46.1。3D 子集比 2D 低 5.8 分,缺口主要在完备性(-8.8),不在视觉(-2.4)。1455 次生成里 15.2% 被检出 UI 重叠或错位;43081 个事件里 5.32% 是代码里有实现、运行时 Fail 或 Partial,其中 56.0% 是加载或崩溃。

模型总分完备性丰富度
Claude-Opus-579.794.472.0
Claude-Fable-575.889.262.8
Kimi-K371.385.256.0
Seed-2.1-pro48.758.430.8

GameFix 上即使最强的 Claude Opus 5,Strict 也只有 39.0,中位数大约 14。清单模式 17 个模型只差约 13 分,自发现模式拉开到约 38 分。Opus 5 的 Cliff 是 7.6,Hy3 是 32.8。把缺陷点名之后,定位加修补已经接近饱和;差距在会不会自己玩、自己验、自己把二十来个独立缺陷收干净。

GameOpt 上 Claude-Opus-5 得到 93.96,Seed-2.1-Pro 只有 35.89。612 次实测里,42.6% 完全集成,49.5% 能玩但不完整,7.8% 不可玩。一个典型对照:同一条界面统一请求,Kimi-K3 的 39 项全过;MiniMax-M3 漏了结束标签,整页空白、脚本不跑,39 项全挂。

为什么重要

对做 coding agent 产品的人,这篇把「能写出一版能点的游戏」从「能把它当产品往下改」拆开了。生成赛道上大家都会先铺骨架,加料、3D、布局稳定性和运行时接线才是分位。修缺陷赛道更刺:给清单大家都会修,不给清单多数模型会漏客观缺陷。优化赛道说明局部改对了不够,一次 HTML 结构错误就能让前面所有维度不可达。

如果只拿「一句话出游戏」当能力海报,会被 GameGen 的完备性分数哄住。三条赛道合在一起,更接近真实共创:先做出能玩的,再自己找坏掉的,再按产品意见改还不把核心循环改崩。

局限与存疑

GameFix 的金标关卡刻意保密,防预训练背题,外部无法复现那 50 个关卡本身。每关 19 到 27 个缺陷是评测设计,论文自己说真实游戏很少一次摊这么多。GameOpt 的轮次和维度绑死,音频永远第六轮、数值集中在第三轮,所以后两轮回升不能当成「长上下文更稳」。三条赛道都停在浏览器 JavaScript 游戏,引擎内、原生客户端没测。GameGen 的共享量规来自各模型产物的事件并集,可能偏向模型已经会做的事件,对人类设计师真正在意、但所有模型都没做出来的内容覆盖不足。

术语

原文与代码

相关论文

全部论文解读