VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu
cs.AI
2026-08-15
HKUST(GZ) 与腾讯建成首个端到端 3D 世界构建 agent 基准与 RL 训练框架,GPT-5.5 整体 Pass@1 仅 57.3%,瓶颈锁定在碰撞规避的 3D 精确编辑;GRPO 后训练的 30B 开源模型拿到 59.3% 反超全部闭源旗舰。
对着一句「搭一个阴森的废土神社」就自动建出可交互 3D 世界,是游戏、仿真、具身智能都想要的能力。现有做法分两类:一类把流程拆成规划、生成、审查几个固定阶段,每段塞一个专用子模型(SceneCraft、3D-GPT);另一类让一个多模态模型自主调工具、多轮改世界(SceneWeaver、SAGE)。两条路有个共同问题:评测全用理想化的简单指令,没人能系统回答「现在的多模态模型到底卡在哪一环」。闭源框架不开源,连「训练能不能补上这块短板」都没法验证。
这篇的回应是三件套:一个基准(VWE-Bench)、一个带验证器的训练场(VibeWorlding-Gym)、两个开源后训练模型。
VWE-Bench 的数据走「先有世界、再反推指令」的路线。美术先用 2,616 个资产搭出 323 个种子世界,模型读世界反写用户指令,人工审核过滤,得到 6,828 条查询。查询分两大类:
每条查询会被六个维度打分:物理可行性(碰撞、高度)加意图达成(生态合理性、3D 理解、3D 推理、资产检索)。
VibeWorlding-Gym 把整个环境统一成五个 MCP 工具(检索、添加、删除、旋转、平移资产)加 Blender 渲染服务,每轮返回五个 1280×720 视角的截图当多模态反馈。验证器是双约束的:几何碰撞走规则检查,意图达成由 Gemini 3.5-flash 按细则打分。这个验证器同时当裁判和 RL 奖励来源。训练分两步:先用过筛轨迹做 2 个 epoch 冷启动 SFT,再用 GRPO 做 1 个 epoch 多模态联合 RL,奖励只看结果(Verified 按改对资产比例给 [0,1] 分数,Unverified 全维度通过给 1),刻意不加中间过程奖励以防 reward hacking。8B 模型单节点 8 张 H20 训练,30B-A3B 用三个节点。
| 模型 | Verified | Unverified | 整体 Pass@1 | 盲评人评通过率 |
| GPT-5.5 | 60.4 | 55.7 | 57.3 | 33.3 |
| Qwen3.8-Max | 58.1 | 62.3 | 56.9 | 46.7 |
| Gemini 3.5-flash | 44.4 | 47.5 | 42.7 | 13.3 |
| Claude-Opus-4.8 | 42.9 | 23.0 | 24.3 | 13.3 |
| Qwen3-VL-30B-A3B(基座) | 22.0 | 13.3 | 13.6 | 13.3 |
| VibeWorlder-30B-A3B(本文) | 64.5 | 62.3 | 59.3 | 47.2 |
三个结论:
第一,旗舰模型离解决这个任务很远。最强的 GPT-5.5 和 Qwen3.8-Max 整体都不到 60%,Claude-Opus-4.8 只有 24.3%。SceneWeaver、SAGE 这类现成 agent 框架搭 GPT-5.5 也只有 13%16%,说明缺的是模型的 3D 能力而非工作流编排。
第二,瓶颈定位明确。六维度拆解显示碰撞是所有模型最弱的一项,即便经过 RL 训练也只有 59%68%。典型失败是把物体准确移动了 77 米,方向却完全反了;或者改了用户没让动的资产。
第三,RL 确实补这块短板。30B 基座从 13.6% 拉到 59.3%,反超所有参测闭源模型。拆开看,SFT 主要立住物理和生态合理性(这两项 RL 期间基本不动,没有提升空间),3D 理解从 0.17 升到 0.80,3D 推理从 0.04 升到 0.69,仍是 RL 后最弱的一项,只算部分解锁。
验证器本身靠得住吗?系统层面它与人类盲评的排序相关达 Spearman ρ=0.88,案例级整体 Pass@1 一致率 83.4%。
对做 agent 训练的人,这是「可验证奖励 + 多模态反馈」范式打进 3D 生成领域的第一个完整开源栈:基准、沙盒、验证器、SFT 加 RL 全链路可复现,直接照搬到自己的 3D 或工具调用任务上。对做内容管线的人,结论很实用:旗舰模型直接 zero-shot 搭世界还不行,但一个 8B 开源模型经 RL 后训练就能到 41.4%,追平 Gemini 3.1-pro,自建世界生成助手的门槛比想象的低。对 MLLM 研究者,「理解到位、编辑失准」这个诊断把下一代的改进靶点钉在了空间量化推理上。
诚实说,59.3% 对 57.3% 的反超幅度不大,且开源模型在这个自建基准上训练、在同分布测试集上评测,有主场优势;对闭源旗舰的结论(都不及 60%)更扎实。
作者自己列了四条:沙盒只有五个原子操作,缺「直接铺一个足球场」这类高层工具;最复杂世界仅 258 个资产,规模小;结果奖励对长程任务天然稀疏;资产库只有卡通风,查询类型也没覆盖图生世界、视频生世界。
读下来还有两处存疑。Verified Pass@1 是「改对资产比例」的均值,不是严格通过率,与 Unverified 的口径不同,两张表直接横比要小心。奖励验证器用的 Gemini 3.5-flash 同时也是参测模型,既是运动员又当裁判的隐患作者用盲评相关性做了对冲,但「Qwen3.8-Max 在 Unverified 子项上拿 62.3% 全场最高」这类由判分模型口径决定的名次,仍可能受判分偏好影响。