腾讯 Hunyuan3D-Buffalo 1.0:一个模型同时做 3D 理解、生成、编辑和部件

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Zhuo Chen, Chunchao Guo

cs.CV

2026-08-04

腾讯 Hunyuan3D-Buffalo 1.0 用单一架构统一 3D 理解、文生3D、指令编辑与部件生成,靠 87M 多模态语料和自造编辑数据,在生成与编辑基准上领先。

这篇在解决什么

3D 这块长期被切成几条互不相通的流水线:理解(看懂一个 3D 物体)、文生 3D(从文字生成)、编辑(改已有物体)、部件生成,各训各的模型。要做成统一模型,最大的拦路虎是数据,尤其是几何一致、量大、能支撑编辑的多模态 3D 数据几乎没有。这篇就是冲着一个架构全包加自己造编辑数据去的。

方法

架构上两块拼起来:

数据是这篇的重头戏。作者搭了个数据引擎,造出 87M 规模语料:25M 理解样本加 50M 文生 3D 对加 12M 编辑对。编辑对靠 Nano3D-v2 这个管线生成,步骤包括锚定视角选择、学出来的 3D 框定位、用 TRELLIS 体素做 FlowEdit 再合并、用 LATTICE 加 NaTex 精修,最后 VLM 过滤。

结果

部件问答基准 UniPart-Bench 上,SBERT 85.47、SimCSE 89.06,最佳。文生 3D 人工评测,三个维度偏好 55.2/57.1/56.6%,超过 Omni123(17.5/21.0/18.4%)两倍多。编辑基准 Edit3D-Bench 上平均倒角距离(CD)0.0091,对比 Omni123 的 0.0684 降了 86.7%;平均 F1 0.6515,对比 Steer3D 的 0.2729 高出 2.39 倍。一个附带发现:生成和理解两方面的训练反过来都让编辑变强,统一训练是互相增益的。

为什么重要

统一 3D 模型省掉了维护多条专模型线的成本,而且理解、生成、编辑互相喂数据互相增强是这条路线的核心卖点。对做 3D 资产、数字孪生、游戏和电商 3D 内容的团队,一个能看、能造、能改的模型比一堆单点工具更接近实用。Nano3D-v2 这个自动造编辑数据的管线本身可复用,缓解了 3D 编辑数据的稀缺。

局限与存疑

作者自己承认两点:高质量几何的单阶段生成还没解决,得靠多阶段 DiT(像 TRELLIS 那种);语料的 caption 质量依赖 Gemini,有噪声。还有几处存疑:部件定位和编辑的强结果很多在自建的 UniPart-Bench 与 Edit3D-Bench 上,这些基准的成熟度和可比性要等社区检验;VLM 用 Qwen-VL 底座,几何理解的精度上限受底座影响;87M 语料里 12M 编辑对是合成的,合成编辑数据训出来的模型在真实复杂编辑指令上泛化如何没充分验证。

术语

原文与代码

相关论文

全部论文解读