腾讯混元发布 Hunyuan3D-Buffalo 1.0,统一 3D 生成、理解与编辑
Tencent-Hunyuan · hf · 2026-08-05
腾讯混元团队推出了 Hunyuan3D-Buffalo 1.0,一个将 3D 理解、文本到 3D 生成、指令引导的 3D 编辑以及文本定位的部件生成统一在单一架构中的框架。
为了解决 3D 多模态数据稀缺的问题,研究团队构建了一个包含 8700 万样本的语料库,涵盖 2500 万理解样本、5000 万文生 3D 对以及 1200 万编辑对。架构上,它结合了负责语义、结构和空间理解的 Hunyuan3D-VLM,以及负责高保真 3D 合成的 Hunyuan3D DiT。
实验表明,该模型在文本到 3D 生成和 3D 编辑基准上达到了 SOTA 表现,并展现出强大的理解和部件生成能力。分析进一步证实,生成和理解能力的融合能够有效提升模型的编辑效果。
「多模态」频道最新
- Higgsfield 推出 10 天无限畅玩:Seedance 2.5 即将上线 — CurieuxExplorer · 2026-08-05
- Derya 分享用 ChatGPT 生成的精美图像 — DeryaTR_ · 2026-08-05
- 单卡B200实现30帧端到端视频编辑,京东开源JoyAI-Video-Edit — jingdong1 · 2026-08-05
- AI 视频整活:死侍乱入《侏罗纪公园》暴龙名场面 — Sad_Coach_1433 · 2026-08-05
- AI 音乐视频怎么做才不像是随机拼接? — ThemeOld5001 · 2026-08-05
- 实测AI Agent自主制作纪录片:从脚本到剪辑全自动 — illscience · 2026-08-05