GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xiaodong Cun, Chi-Man Pun, Zhiguo Cao, Ying Shan
cs.CV, cs.AI
2026-09-22
腾讯 ARC 用 100 名玩家录下 21 款 AAA 游戏共 5000 小时键鼠对局,自动标出短中长三层指令。47 个模型、5000 道离线题显示:当前动作感知明显强于未来动作规划,长程在线成功率大多不超过 10%。
评游戏 AI 一直缺一把能同时量感知、规划和按键的尺子。现有数据要么困在 Minecraft 或小游戏,要么没有语言指令,要么只靠少量在线 rollout,方差大、不可复现。专用游戏智能体为了刷控制频率把规划砍掉;通用 VLM 会规划,却几乎没在统一动作空间上被测过。
腾讯 ARC Lab 做了一套三件套:自动标注管线、5000 小时 AAA 对局数据、离线加逐步在线的基准,把短操作、中目标、长策略压进同一套评测。
100 名熟练玩家用专用录制系统同步抓 2K/60fps 画面和键鼠事件,共 4571 段视频、4.1103 亿次动作。过滤过场和切窗后,4341 小时(86.8%)进入指令标注。
标注自底向上。先用键鼠关键动作切短片段,VLM 写成 1–5 秒的 L1 操作;再按动作连续性和语义合并成 1–2 分钟的 L2 目标、5–8 分钟的 L3 策略,动态规划卡住时长。最终 618 万条互异指令:L1 约 595 万、L2 约 18.9 万、L3 约 4.7 万。平均每 2.63 秒一条 L1,每帧对齐三层文字。
离线基准把对齐三元组做成四选一:T1 单层动作、T2 把中目标拆成 L1 序列、T3 跨层一致性,各 1000 题,另加 10 组诊断变体共 2000 题。在线轨在 Minecraft 里做 10 个有序因果任务和 10 个可换序主题任务,共 62 个子任务;失败就重置到成功态,便于定位是哪一步炸的。
47 个模型、超过一百万次调用。44 个能做问答的模型离线均分 64.7%,跨度 44.6% 到 80.2%。难度梯度清楚:T1 57.3%、T2 65.1%、T3 71.6%。GPT-6-Astra 总分 80.2%,Gemini 3.8 Flash 77.3%。开源里 Kimi-K3 以 74.5% 挤进第一档。GUI 智能体掉到第四档(UI-TARS-1.5-7B 53.0%)。专用游戏智能体在未见过的 AAA 上接近随机:NitroGen 22.0%,JARVIS-VLA 28.1%;同一 JARVIS-VLA 在 Minecraft 域内能到 54.2%。
| 设置 | 当前动作 | 未来动作 |
| 只看画面 | 44.5% | 34.6% |
| 加短指令 | 58.6%(+14.1) | 34.8% |
| 再加中长指令 | 60.0% | 41.8%(+7.0) |
自底向上抽象准确率 98.4%,自上而下分解只有 69.5%。在线轨与离线档位同向:GPT-6-Astra 长程任务 45.0%,其余 12 个里有 10 个不超过 10%。
这是目前唯一同时满足大规模、AAA、真人键鼠、稠密多层指令的公开对局集。离线 MCQ 可复现,在线逐步重置能把「不会做蛋糕」和「会配方但放错位置」拆开。对做游戏 VLA 的人,短指令主要帮当前动作,中长指令才帮未来规划,训练数据不该只标一句总目标。
专用游戏智能体出了训练域就接近瞎猜。GUI 智能体的电脑用例训练也转不过来。规划未来动作,仍是这批模型的短板。
在线轨只能放在 Minecraft,因为多数 AAA 不暴露内部状态,和数据覆盖的 21 款 3A 并不重合。标注全靠 VLM,标签噪声没有大规模人工审计。专用智能体只在 T1 上用序列对齐硬套选项,和问答模型不是同一套协议。选择题测的是识别,不是闭环高频控制。思考链让小模型掉 5.9–8.2 分。长程在线对第一名也只有 45%。