腾讯混元 WorldClaw:agent 粗到细生成可漫游、资产可编辑的 3D 开放大世界

WorldClaw: Agentic 3D Open-World Generation at Scale

Chunchao Guo, Jinpeng Li, Yang Li, Zilong Huang

cs.AI, cs.CV

2026-08-05

WorldClaw 用 planning agent 把文本拆成区域、地形、资产规范,先建全局地形再逐区生成可编辑 3D 资产,render-based agent 反复修正接触与外观,产物是独立可编辑的贴图网格。

这篇在解决什么

从一句开放文本生成一个能自由漫游的 3D 大世界,难点是要同时满足三件互相打架的事:全局空间要连贯,局部内容要丰富,产出的资产还得能拿去编辑复用。大多数现有方法要么只能合成单视角漂亮画面,要么产出的场景是一整块网格、里面的物体没法单独动。

腾讯混元团队这篇报告的取舍是:不训练一个端到端的大世界生成模型,而是用 agent 把现有的基础模型编排成一条流水线,把「全局组织」和「局部实例」拆开来做。

方法

WorldClaw 是粗到细的 agent 框架,分三个阶段。

第一阶段是意图分析与规划。意图分析 agent 和场景规划 agent 把开放文本转成结构化场景规范,写明各个区域、地形类型、所需资产、材质风格和空间关系。第二阶段是全局地形生成:在语义布局图引导下,用程序化方法建区域感知的高度场,搭出有起伏、有分区语义的连续地形,再配可复用资产和生成式或程序化材质。第三阶段是区域对象生成与放置:把局部地形渲染成二维图,用图像编辑模型在上面合成对象,再用图生三维模型重建为可编辑贴图网格,放回地形上。

最后是 render-based agent 的精修循环。agent 从诊断视角重新渲染场景,检查对象的姿态、网格质量、尺度以及与地形的接触(悬浮、过度穿透、支撑不稳),在局部支撑区内做对象与地形的协同形变来修正,反复迭代直到通过检查或达到迭代预算。

整套流水线用 Claude Opus 4.8 做 agent,搭配 GPT-Image-2、SAM3、SAM3D、Hunyuan3D 等基础模型,在 Blender 5.1.1 里执行,4 块 H20 GPU。产物是独立可编辑的贴图网格加全局地形,能直接进游戏引擎。

结果

论文没有给出任何量化指标。全部结果都是定性的:展示了四个示例世界(热带岛屿、峡谷、沙漠、雪山),给了全局俯瞰、区域特写和漫游视角,以及对应的实例、深度、法线渲染。对比也是定性的,对象是 SynCity、Marble、MajutsuCity、WorldGen、GPT-5.6 Sol,从地形组织、内容丰富度、自由视角稳定性、实例可编辑性几个角度说 WorldClaw 更好。

维度论文给出的依据
地形与区域组织连续全局地形、明显高差、语义分区相连
内容丰富度按区域功能放置建筑、植被、车辆
自由视角全局地形加独立对象网格,长距离漫游几何稳定
实例可编辑性输出独立贴图网格,支持资产复用与引擎工作流

为什么重要

定位很清楚:面向生产。很多 3D 生成方法产出的是炫但不可用的场景,WorldClaw 强调产物是独立可编辑的网格、能进游戏引擎、资产可复用,这是往实用走的一步。把全局地形和局部实例解耦的设计,也直接对应了「大世界既要整体连贯又要局部可控」的真实需求。

对从业者,它提供了一个可参考的 agent 编排范本:用强模型当规划与调度,把程序化地形、图像编辑、图生三维这些现成工具串起来。

局限与存疑

最突出的问题是没有任何量化评测。所有结论都是定性比较,「比基线好」靠的是看图说话,没有客观指标也没有用户研究,说服力有限。

作者自己列了三条局限。一是对底层模型依赖极重:实验里开源语言模型和图像模型常常顶不住,要么写不出能跑又符合要求的地形程序,要么保不住对象外观和姿态,必须用 Claude Opus 4.8、GPT-Image-2、Hunyuan3D 这类强模型才能跑通。二是代码生成不稳定:把自然语言转成 Blender 程序仍很难,尺度、参数、节点连接出错会直接体现在场景里,要反复渲染检查。三是效率开销大:逐个生成重建对象、多轮精修,延迟和算力随对象数和迭代数上涨,简单场景也走这条长流程不划算。

更根本地看,这篇是工程编排,不是新模型。它的天花板就是底层那几个基础模型的天花板,3D 重建质量直接决定场景观感。

术语

原文与代码

社区讨论

相关论文

全部论文解读