Stream3D: Sequential Multi-View 3D Generation via Evidential Memory
Kaichen Zhou, Zeyang Bai, Xinhai Chang, Mengyu Wang, Paul Liang, Fangneng Zhan
cs.CV
2026-05-21
Stream3D 是免训练方案,给冻结的单视图 3D 生成器装一个定长的「证据记忆」,从历史帧挑最有信息量的缓存,在 GSO 上把重建误差 CD 从 0.094 降到 0.048。
现在的单视图条件 3D 生成器(SAM 3D、TRELLIS、Hunyuan3D 这类)给一张图就能重建出高质量物体。可现实里的视觉观测往往是一段长长的单目视频流。最朴素的办法是逐帧独立扔给生成器,结果是严重的时序不一致:同一物体这一帧长这样、下一帧变了个样。
已有的「隐式传输」类做法想接着用,要么靠复用 KV-cache,要么靠流式特征编辑,问题都会累积误差,而且内存随序列长度线性涨,流一长就退化。
Stream3D 是免训练方案,不动冻结的生成器一分钱(不改结构、不重训、不加辅助损失)。它维护一个紧凑的「证据记忆」,按一套证据分数(evidence score)从历史帧里挑最有信息量的缓存下来。证据分数来自交叉注意力的统计:一帧里某些 token 对当前重建贡献大、熵低,就算「证据强」。
记忆是定长的:每个 token 只保留 top-D 个证据最强的历史帧。流往后走,记忆动态更新,但条数固定,所以内存占用恒定(论文给的是约 65KB),不随序列长度增长,长序列也不退化。选哪些帧参与生成,靠对所有 token 的偏好做一次「归属计数」聚合,再取 top-K 帧。
在 GSO 和 NAVI 两个流式基准上对比,Stream3D 全面领先。GSO 上的几何指标(倒角距离 CD,越低越好)从 SAM3D 的 0.094 降到 0.048,体积 IoU 从 0.664 升到 0.775,渲染质量也更好。
| 方法 | CD↓ | IoU↑ | 渲染 FID↓ |
| SAM3D | 0.094 | 0.664 | 105.20 |
| SAM3D + KV-Cache | 0.084 | 0.682 | 83.35 |
| MV-SAM3D(随机 K 帧) | 0.064 | 0.676 | 83.04 |
| Stream3D | 0.048 | 0.775 | 66.71 |
相比 KV-cache 复用和流式特征编辑这些隐式传输基线,Stream3D 在光度与几何指标上都更优,且记忆恒定不膨胀。
单视图 3D 生成器已经很能打,但落地到视频流就崩。Stream3D 不要求重训基础模型,等于给现成的强生成器加了一个即插即用的流式外壳,把它们的应用面从「一张图」扩到「一段流」。对做 AR、机器人感知、3D 重建的团队,这是低成本的升级路径。
作者自己点明,这套方法的天花板就是底层生成器。如果基础模型连单视图都重建不好,证据记忆也救不回缺失的几何或外观,它只是把已有能力稳定地铺到时间维度上,不会无中生有。证据分数和记忆深度(D)、捆绑大小(K)这些超参是在特定基准上调出来的,换到更剧烈运动或更极端视角的流上是否还最优,文中没充分压测。免训练的代价是无法针对流式任务专门优化权重,潜力可能没榨干。