NVIDIA 把扩散模型当渲染器,G-buffer 进逼真视频出

RGBX-Next: Towards Realistic Generative Rendering from G-Buffers

Zheng Zeng, Marco Salvi, Lifan Wu, Jan Novák, Daqi Lin, Saeed Hadadan, Yichen Sheng, Robert Pottorff, Shiqiu Liu, Ravi Ramamoorthi, Ling-Qi Yan, Miloš Hašan

cs.CV, cs.GR

2026-08-14

NVIDIA 把 Wan 2.1 14B 视频扩散模型微调成渲染器:G-buffer 进逼真画面出,反向可估 G-buffer,多数指标超既有方法。

这篇在解决什么

传统渲染管线的控制是精确的:几何、材质、光照都定义清楚,路径追踪才能出图,代价是资产制作只有大制作团队养得起。扩散模型正好倒过来,画面逼真但控制粗糙:一句提示词管不住相机在哪、桌面该是什么材质,时序稳定性也靠不住。NVIDIA 这篇押的路线是两边各取一半:用传统管线渲出 G-buffer(反照率、法线、深度、材质、辐照度、直射光这类几何与光照中间层),把它喂给微调过的视频扩散模型,让模型补上照片级真实感。反方向也能跑:从真实图像视频估出 G-buffer,即本征分解。

方法

底座是 Wan 2.1 14B 视频扩散 transformer(DiT),VAE 冻结。核心是把 DiT 的「帧预算」改装成条件通道:

对照组是 DiffusionRenderer 式的通道拼接,收敛明显更差,因为模型要硬把帧间注意力改造成输入输出间的注意力;VACE 式上下文 token 也比了,通用性与质量都逊一档。

训练数据两套:内部 900 条路径追踪视频序列(各约 100 帧,带真值 G-buffer);6,622 条 Pexels 真实视频,用自家 RGB→X 模型标伪 G-buffer,留 371 条做测试,Qwen2.5-VL 配字幕。训练时按 50% 概率整模态丢弃,配合空间掩码和高斯模糊,推理时就能只控几何不控光照。流式版本用干净参考帧做长上下文,加 self forcing 训练,支撑不定长度的双向流。

结果

RGB→X 在 Hypersim 测试集(模型没在这个集上训练过;RGB↔X 训练过):

方法Albedo PSNRNormal PSNRIrradiance PSNRDepth PSNR
RGB↔X18.3919.2511.66n/a
DiffusionRenderer15.2921.54n/a17.72
RGBX-Next20.1721.2225.1929.47

X→RGB 在留出测试集上的 FID:通道拼接 88.60,VACE 62.29,RGB↔X 62.39,RGBX-Next 45.39。速度是短板:单张 A100 80GB 上 17 帧 1280×720,RGB→X 约 200 秒(CFG=1),X→RGB 约 400 秒(CFG=3),20 步采样。

为什么重要

对游戏和影视,这条路线意味着资产只需做到 G-buffer 级别的粗定义,真实感交给学到的先验补全,省掉高精度材质与光照的制作成本。论文把模型定位成教师模型,后续靠蒸馏(DMD 一类)压向交互速度,并押注未来 GPU 的推理算力会让蒸馏版反超蒙特卡洛渲染。逆方向的视频本征分解对重打光、后期合成是现成工具。方法层面给了一条通用配方:任何视频 DiT 都能这样改装成多输入、多输出、多模态模型,全部模型承诺开源。

局限与存疑

作者自述:模型不比底座 Wan 2.1 14B 快,离交互级很远;G-buffer 是不是最优控制信号还没有定论;公开数据集缺可靠的粗糙度、金属度真值,材质估计没做定量评测;流式误差累积只是缓解;真实训练数据的伪 G-buffer 带着自家模型的偏置。

读下来的疑问:内部 900 条合成数据未随文发布,复现系于承诺中的模型放出;对照并不全胜,法线 PSNR 低于 DiffusionRenderer,辐照度 LPIPS 劣于 RGB↔X;FID 在自家伪标注的留出集上算,评测半自指;视频与流式结果是定性展示加耗时数字,缺独立的定量视频指标。

术语

原文与代码

社区讨论

相关论文

全部论文解读