GaussianGPT 用自回归 next-token 生成 3D Gaussian 场景
rsasaki0109 · x · 2026-07-28
GaussianGPT 用自回归方式生成 3D Gaussian 场景
这篇 ECCV 2026 论文尝试了一条不同于 diffusion / flow-matching 的路线:用完全自回归的 transformer,通过 next-token prediction 直接生成 3D Gaussians,从而完成整幅 3D 场景生成。
方法要点
- 先用带 vector quantization 的稀疏 3D 卷积自编码器,把 Gaussian primitives 压缩成离散 latent grid。
- 再把这些 token 序列化,交给带 3D rotary positional embedding 的 causal transformer。
- 模型按步骤生成空间结构和外观,而不是像 diffusion 那样整体迭代细化。
能力展示
- 场景补全
- outpainting
- 可控生成
- 更大规模的 3D 场景生成
「多模态」频道最新
- 用户分享一个 Midjourney 新风格及其提示词参数 — azed_ai · 2026-07-28
- 120 张标注图训练出一个 5MB 的 McBess 风格 LoRA — Winter_unmuted · 2026-07-28
- TopviewAI 推出 Film Studio,支持 3D 分镜和微表情控制 — XFreeze · 2026-07-28
- 图像生成避坑:如何正确测试混合了画风的角色LoRA — Dark_Sytze · 2026-07-28
- Oxygen-TryOn 以时尚原生模型做多件虚拟试衣 — JD-company · 2026-07-28
- FilmBench 用电影学院 shot list 评测视频生成 — Shengyi Wang · 2026-07-28