13 维高斯直接拟合渲染方程,训练约 10 分钟、1080p 跑到 63 fps

Gaussian Light Transport

Patrick Attimont, Kartic Subr, Cyril Soler

SIGGRAPH Asia 2026 (Conference T

cs.GR

2026-09-10

INRIA 把全局光照写成位置、方向、法线和材质上的 13 维高斯混合,对着渲染方程残差优化。Living Room 训练 11 分 30 秒,1920×1080 一像素 16.5ms,比 Vertex Features 快 3.7 倍。

这篇在解决什么

全局光照要的是整场辐射,任意相机切一刀就能出图。路径追踪按视角重算,多视角漫游很贵。辐射度那一类 Galerkin 方法给出与视角无关的解,却很难撑住焦散、光泽反射这种高频。Neural Radiosity 用网络去拟合渲染方程残差,表示绑在网格或哈希格上,显存大、训练慢,对场景内容也不自适应。

问题可以收成一句:找一种跟几何解耦、内存只有几 MB、还能实时切片的辐射场。

方法

辐射场 L 写成 M 个 13 维高斯的加权和。每个高斯活在位置 x、出射方向 ω、法线 n、反照率 a、粗糙度 r 拼起来的 13 维空间里。把材质和法线塞进表示,是为了让相同外观的不相邻表面共享同一个高斯,不必按网格铺函数。

优化目标是直接最小化渲染方程残差,不去拟合一张路径追踪图:L 应当等于自发光加上运输算子作用在 L 上的结果。损失在面积和方向上做蒙特卡洛估计,用半梯度,内层积分不回传,换方差。训练时每个出射方向再采 32 个入射方向加 32 个显式光源样本。

高斯数量跟着残差走,像 3D Gaussian Splatting 那样分裂、按残差生成、按相对能量贡献剪枝(阈值 τ=8×10⁻³)。协方差做成块对角:位置、方向、材质、法线各管一块,放弃跨子空间相关,换空间局部性和更快求值。位置上加各向异性惩罚(λ=0.008),避免接触区域被拉成细长亮带。损失还按当前预测归一,免得只学亮部。

求值用世界空间 Morton 码把查询打成 tile,再按 13 维包围盒剔除高斯。Bedroom 场景大约 2.2 万个高斯,每像素平均只算 76 个。实现是 Mitsuba 管场景,PyTorch 管优化,Taichi 写求值和解析导数。镜面路径会延长到第一块光滑表面,模型不直接学完全镜面分布。

出图有两种切法。GS 模式在相机可见点直接读 L。GS+MC 先弹一跳,把模型当入射辐射。

结果

对照是 Neural Radiosity 加顶点特征(Su et al., 2025),RTX 4080 SUPER,1920×1080、1 spp。己方固定 3 万步,基线练到伪影清掉(4 万到 10 万步)。训练快 10.0 到 23.4 倍,渲染快 2.2 到 4.5 倍,六场景里五个 FLIP 更低。模型体积 1 到 5.9MB;哈希格编码固定 35.7MB,顶点特征从 0.9MB 到 26.4MB。

场景训练模型1 sppFLIP(己方 / VF)
Bedroom10m48s vs 2h10m4.4 vs 26.4MB18.1 vs 70.4ms0.0824 / 0.0774
Chair10m07s vs 1h42m4.3 vs 1.9MB16.1 vs 52.3ms0.0486 / 0.0602
Dining Room9m17s vs 1h54m5.4 vs 6.0MB13.5 vs 60.2ms0.0831 / 0.1012
Living Room11m30s vs 4h29m5.8 vs 5.3MB16.5 vs 61.5ms0.1177 / 0.1362
Rings7m37s vs 1h30m1.0 vs 0.9MB19.9 vs 44.0ms0.0425 / 0.0509
Veach Ajar12m08s vs 2h25m4.1 vs 6.5MB13.0 vs 46.5ms0.0641 / 0.1499

Living Room 的 16.5ms 大约 63 fps。Bedroom 是六个场景里唯一 FLIP 略差的。消融上,拿掉分裂、生成或材质/法线维,MSE 都会抬;Bedroom 全模型 0.00636,无分裂 0.03354。GS+MC 在 1 spp 更噪,1024 spp 后全面超过纯 GS。

为什么重要

这是把 3D Gaussian Splatting 那套显式、可裁剪、可自适应的核,搬去解渲染方程,不是再拟合一张已渲染的光场。对要做建筑漫游、烘焙间接光的人,几 MB 的与视角无关解、分钟级训练、毫秒级切片,比 Neural Radiosity 那条网更像能塞进查看器的东西。

它解决的是静态场景的预计算全局光,不是动态场景,也不是路径追踪的通用替代。渐进改进在「表示」上,物理求解框架仍是残差最小化。

局限与存疑

作者写得很直。残差目前按表面均匀采样,偏向学大空间足迹的高斯,弯曲高光泽面更吃基于曲率或带宽的采样。实现只覆盖静态场景。tile 剔除假定查询在空间和方向上成团,训练和 GS+MC 里这个假设变弱,方向剔除变差,最坏大约慢 1.5 倍。高斯天生光滑,只在反照率、法线、粗糙度跳变的地方保得住锐边;单靠位置或方向不连续的辐射会被抹软,近镜面高光最明显。

有限个高斯本身就给解加了偏置。Bedroom 的 FLIP 没有超过顶点特征基线,六场景里并不是处处赢。动态物体、参与介质都还在未来工作里。

术语

原文与代码

社区讨论

相关论文

全部论文解读