Stream3D 不重训就给 3D 生成器装上「证据记忆」,稳住视频流重建

Stream3D: Sequential Multi-View 3D Generation via Evidential Memory

Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan

cs.CV

2026-05-21

Stream3D 是免训练方案,给冻结的单视图 3D 生成器装一个定长的「证据记忆」,从历史帧挑最有信息量的缓存,在 GSO 上把重建误差 CD 从 0.094 降到 0.048。

这篇在解决什么

现在的单视图条件 3D 生成器(SAM 3D、TRELLIS、Hunyuan3D 这类)给一张图就能重建出高质量物体。可现实里的视觉观测往往是一段长长的单目视频流。最朴素的办法是逐帧独立扔给生成器,结果是严重的时序不一致:同一物体这一帧长这样、下一帧变了个样。

已有的「隐式传输」类做法想接着用,要么靠复用 KV-cache,要么靠流式特征编辑,问题都会累积误差,而且内存随序列长度线性涨,流一长就退化。

方法

Stream3D 是免训练方案,不动冻结的生成器一分钱(不改结构、不重训、不加辅助损失)。它维护一个紧凑的「证据记忆」,按一套证据分数(evidence score)从历史帧里挑最有信息量的缓存下来。证据分数来自交叉注意力的统计:一帧里某些 token 对当前重建贡献大、熵低,就算「证据强」。

记忆是定长的:每个 token 只保留 top-D 个证据最强的历史帧。流往后走,记忆动态更新,但条数固定,所以内存占用恒定(论文给的是约 65KB),不随序列长度增长,长序列也不退化。选哪些帧参与生成,靠对所有 token 的偏好做一次「归属计数」聚合,再取 top-K 帧。

结果

在 GSO 和 NAVI 两个流式基准上对比,Stream3D 全面领先。GSO 上的几何指标(倒角距离 CD,越低越好)从 SAM3D 的 0.094 降到 0.048,体积 IoU 从 0.664 升到 0.775,渲染质量也更好。

方法CD↓IoU↑渲染 FID↓
SAM3D0.0940.664105.20
SAM3D + KV-Cache0.0840.68283.35
MV-SAM3D(随机 K 帧)0.0640.67683.04
Stream3D0.0480.77566.71

相比 KV-cache 复用和流式特征编辑这些隐式传输基线,Stream3D 在光度与几何指标上都更优,且记忆恒定不膨胀。

为什么重要

单视图 3D 生成器已经很能打,但落地到视频流就崩。Stream3D 不要求重训基础模型,等于给现成的强生成器加了一个即插即用的流式外壳,把它们的应用面从「一张图」扩到「一段流」。对做 AR、机器人感知、3D 重建的团队,这是低成本的升级路径。

局限与存疑

作者自己点明,这套方法的天花板就是底层生成器。如果基础模型连单视图都重建不好,证据记忆也救不回缺失的几何或外观,它只是把已有能力稳定地铺到时间维度上,不会无中生有。证据分数和记忆深度(D)、捆绑大小(K)这些超参是在特定基准上调出来的,换到更剧烈运动或更极端视角的流上是否还最优,文中没充分压测。免训练的代价是无法针对流式任务专门优化权重,潜力可能没榨干。

术语

原文与代码

社区讨论

相关论文

全部论文解读