Luce: Relightable Gaussians for 3D Asset Generation
Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs
cs.CV, cs.AI, cs.GR
2026-08-25
Apple 的 Luce 给每个体素各放一套 albedo、金属-粗糙度、法线高斯,用 rectified-flow 从单张图生成可重打光资产。Toys4K 上 FID 20.99,比 TRELLIS 2 的 29.22 低约 28%;130 张 AI 图上 CLIP 0.8519 对 0.8299。
单图生成 3D 已经能出像样的形状,卡在材料。3D Gaussian Splatting 把光照烤进外观,换一盏灯就不对;网格加纹理能进生产管线,却往往把表面上的字、logo、刻痕抹平。TRELLIS 2 走了体素上的 PBR 属性,LiTo 用球谐函数吃视相关效果,两者都没有把「几何」和「能重打光的材质」放进同一套可生成的高斯表示里。
Apple 的 Luce 要的是一张图进,出来一份带 albedo、金属度、粗糙度、法线的资产,能在任意环境光下着色,也能可选地导出带切线空间法线贴图的网格。卖点写在表面上的字还能否认。
表示是体素化的多模态高斯云。物体表面穿过的每个体素,给 albedo、金属-粗糙度、法线各放一套高斯,位置、尺度、旋转、不透明度彼此独立。抛光木头的木纹要密 albedo,拉丝金属的划痕要密法线和粗糙度,一套共享高斯会让三种模态抢同一批图元。法线是单独存的,不必等于几何法线,后面才能把比网格更细的细节烘焙成法线贴图。
渲染不做球谐。三套高斯各自按 3DGS 做 alpha 合成,得到每像素的 albedo、金属、粗糙、法线,再用 Cook-Torrance 微表面 BRDF 加 split-sum 图像光照做延迟着色。视相关高光是解析算出来的。
原始高斯云太肥,直接生成划不来。SLatVAE 把 128³ 稀疏网格、每模态每体素 K=8 个高斯,压到 64³ 的每体素 32 维潜空间;解码器留在粗分辨率,每模态每体素吐 K'=32 个高斯,用空间分辨率换密度。重建损失是按模态可微渲染的 ℓ1+LPIPS+SSIM,外加 KL。编码器 16 层稀疏 Transformer,几乎全程在 128³ 上算,最后一步才下采样。
生成沿用 TRELLIS 的 structure-then-latent。稀疏结构流直接搬 TRELLIS 2 的预训练权重,先决定哪些体素被占用;SLatFlow 是 30 层 DiT,在占用体素上一次生成完整的 PBR 潜变量。条件来自 DINOv2 ViT-L/14 的第 6、12、18、24 层特征拼接,浅层保空间细节,深层保语义。同一套潜变量有两条出路:高斯解码器直接 splat,或 FlexiCubes 网格解码器加四张贴图(漫反射、金属、粗糙、切线法线)。
训练数据是 Objaverse / Objaverse-XL 里滤过的约 50 万份 PBR 资产,加上 TexVerse 的 15.8 万份。每个资产 150 个球面相机、1024² 的三模态渲染,法线通道带着作者法线贴图。VAE 和 flow 各在 64 张 H100 上跑 50 万步,各约 14 天。
主评测是 Toys4K 上 412 个资产的单图生成,以及 130 张 Gemini 3.1 Flash Image 出的含文字、logo、混合材质的 AI 图。H100 上平均耗时。
| 方法 | 参数量 | 耗时 | Toys4K FID↓ | Toys4K CLIP↑ | AI 图 CLIP↑ |
| TRELLIS GS | 1.70B | 29.6s | 30.75 | 0.8898 | 0.8299 |
| TRELLIS 2 | 7.48B | 176.7s | 29.22 | 0.8895 | 0.8110 |
| LiTo | 1.84B | 76.4s | 29.76 | 0.8909 | 0.8234 |
| Luce GS | 4.48B | 42.2s | 20.99 | 0.9062 | 0.8519 |
| Luce 网格+切线法线 | 4.58B | 159.2s | 21.10 | 0.9072 | 0.8508 |
Toys4K 上 FID 从最强基线 TRELLIS 2 的 29.22 降到 20.99,相对约 28%,和摘要口径一致。带切线法线的网格在 CLIP / SigLIP2 上略高于高斯路径。自建 AI 图上 CLIP 0.8519 对 TRELLIS GS 的 0.8299。
重建(Toys4K 的 338 个带齐三张 PBR 贴图的资产)是表示质量的旁证,不是主贡献。Luce GS 着色 PSNR 36.1 dB,法线 34.6 dB,都高于 TRELLIS 2 的 34.5 / 32.1;albedo 和金属-粗糙度 PSNR 输给 TRELLIS 2(38.6 对 40.7,39.1 对 42.7)。切线法线烘焙把网格法线 PSNR 从 29.5 拉到 33.0 dB,不增加面数。
消融很干净。DINOv2 只用第 24 层时,Toys4K FID 从 20.99 升到 25.21,AI 图 CLIP 从 0.8519 掉到 0.8081。多层条件是保字、保 logo 的主要开关。
评测光照和条件光照不是同一张 HDRI。会做材质分解的方法(Luce、TRELLIS 2)被重打光到评测环境,外观烤死的 TRELLIS / LiTo 带着条件光照进 FID。Luce 的 SLatFlow 条件分辨率是 1036²,TRELLIS / LiTo 是 518²,TRELLIS 2 潜变量阶段用 DINOv3、1024²。数字领先,对照并不完全齐。
这是把生成式 3D 往生产资产格式推近一步,不是又一个只在固定光照下好看的 radiance field。高斯路径 42 秒、4.5B,比 TRELLIS 2 的 177 秒、7.5B 轻,比 TRELLIS GS 的 30 秒慢一截,但换来可重打光和能读的表面文字。网格路径要 150 秒量级,更接近「能进 DCC」而不是交互预览。
从业者如果要的是能换环境光、带 PBR 贴图的物件级资产,这条表示比球谐外观更对口。如果要的是最快出个看起来像的 3D,TRELLIS GS 仍更便宜。这是渐进,但是打在材质分解和高频细节上的渐进,不是刷 0.5 个 FID。
作者自己列了四条。体素分辨率有限,相对整体尺度很细的特征可能只占几个体素。材料模型是标准金属工作流加 Cook-Torrance,没有次表面散射、各向异性、半透明、薄膜干涉。网格导出沿用 TRELLIS 的 FlexiCubes,UV 感知的提取还没做。管线是物件级,场景级的光照一致性和物体交互是空白。
对照条件也不齐,上面已经写了。自建的 130 张 AI 图由同一家模型出图、提示词偏向「细节多、有字」,Luce 的多层 DINOv2 正是为这类信号设计的,泛化半径还没有独立验证。论文没有公开代码或权重的说明写在正文里,复现成本按 64×H100×14 天×2 来估。