RGBX-Next: Towards Realistic Generative Rendering from G-Buffers
Zheng Zeng, Marco Salvi, Lifan Wu, Jan Novák, Daqi Lin, Saeed Hadadan, Yichen Sheng, Robert Pottorff, Shiqiu Liu, Ravi Ramamoorthi, Ling-Qi Yan, Miloš Hašan
cs.CV, cs.GR
2026-08-14
NVIDIA 把 Wan 2.1 14B 视频扩散模型微调成渲染器:G-buffer 进逼真画面出,反向可估 G-buffer,多数指标超既有方法。
传统渲染管线的控制是精确的:几何、材质、光照都定义清楚,路径追踪才能出图,代价是资产制作只有大制作团队养得起。扩散模型正好倒过来,画面逼真但控制粗糙:一句提示词管不住相机在哪、桌面该是什么材质,时序稳定性也靠不住。NVIDIA 这篇押的路线是两边各取一半:用传统管线渲出 G-buffer(反照率、法线、深度、材质、辐照度、直射光这类几何与光照中间层),把它喂给微调过的视频扩散模型,让模型补上照片级真实感。反方向也能跑:从真实图像视频估出 G-buffer,即本征分解。
底座是 Wan 2.1 14B 视频扩散 transformer(DiT),VAE 冻结。核心是把 DiT 的「帧预算」改装成条件通道:
对照组是 DiffusionRenderer 式的通道拼接,收敛明显更差,因为模型要硬把帧间注意力改造成输入输出间的注意力;VACE 式上下文 token 也比了,通用性与质量都逊一档。
训练数据两套:内部 900 条路径追踪视频序列(各约 100 帧,带真值 G-buffer);6,622 条 Pexels 真实视频,用自家 RGB→X 模型标伪 G-buffer,留 371 条做测试,Qwen2.5-VL 配字幕。训练时按 50% 概率整模态丢弃,配合空间掩码和高斯模糊,推理时就能只控几何不控光照。流式版本用干净参考帧做长上下文,加 self forcing 训练,支撑不定长度的双向流。
RGB→X 在 Hypersim 测试集(模型没在这个集上训练过;RGB↔X 训练过):
| 方法 | Albedo PSNR | Normal PSNR | Irradiance PSNR | Depth PSNR |
| RGB↔X | 18.39 | 19.25 | 11.66 | n/a |
| DiffusionRenderer | 15.29 | 21.54 | n/a | 17.72 |
| RGBX-Next | 20.17 | 21.22 | 25.19 | 29.47 |
X→RGB 在留出测试集上的 FID:通道拼接 88.60,VACE 62.29,RGB↔X 62.39,RGBX-Next 45.39。速度是短板:单张 A100 80GB 上 17 帧 1280×720,RGB→X 约 200 秒(CFG=1),X→RGB 约 400 秒(CFG=3),20 步采样。
对游戏和影视,这条路线意味着资产只需做到 G-buffer 级别的粗定义,真实感交给学到的先验补全,省掉高精度材质与光照的制作成本。论文把模型定位成教师模型,后续靠蒸馏(DMD 一类)压向交互速度,并押注未来 GPU 的推理算力会让蒸馏版反超蒙特卡洛渲染。逆方向的视频本征分解对重打光、后期合成是现成工具。方法层面给了一条通用配方:任何视频 DiT 都能这样改装成多输入、多输出、多模态模型,全部模型承诺开源。
作者自述:模型不比底座 Wan 2.1 14B 快,离交互级很远;G-buffer 是不是最优控制信号还没有定论;公开数据集缺可靠的粗糙度、金属度真值,材质估计没做定量评测;流式误差累积只是缓解;真实训练数据的伪 G-buffer 带着自家模型的偏置。
读下来的疑问:内部 900 条合成数据未随文发布,复现系于承诺中的模型放出;对照并不全胜,法线 PSNR 低于 DiffusionRenderer,辐照度 LPIPS 劣于 RGB↔X;FID 在自家伪标注的留出集上算,评测半自指;视频与流式结果是定性展示加耗时数字,缺独立的定量视频指标。