港科大等提出 Stream3D:视频流式生成完整 3D 物体
机器之心 · wechat · 2026-08-02
港科技大学、MIT 和哈佛大学联合团队提出 Stream3D,结合了 3D 重建的观测忠实度与 3D 生成的先验补全能力。该框架为冻结的单图 3D 生成器(如 SAM3D、TRELLIS)引入了无需训练的流式机制,能从持续到来的单目视频流中生成跨视角一致的完整 3D 模型。
核心机制是自适应证据记忆:
- 注意力探针:通过单步去噪的交叉注意力,评估当前视角对 3D 空间各局部的观测可靠度。
- 固定容量记忆:为每个 token 维护固定大小的可靠历史视角列表,不随视频长度增加而膨胀。
- 多视角投票:生成阶段由 token 选出最具代表性的 Top-K 帧共同参与生成。
实验表明,Stream3D 在 GSO 和 NAVI 数据集上的几何与外观指标均优于逐帧生成和纯流式重建方案,有效解决了视频 3D 生成中的时间不一致和背面缺失问题。
「多模态」频道最新
- OraRL:高效可扩展的视频 MLLM 强化学习 — Yunheng Li · 2026-08-26
- 用 Google Gemini 生成女孩仰望天空蓝鲸的感人动画 — michaelrabone · 2026-08-26
- AI 生成舞蹈视频展示炫酷动作效果 — No-Bookkeeper-char · 2026-08-26
- ECCV 2026 新研究:Face Anything 实现任意序列 4D 人脸重建 — rsasaki0109 · 2026-08-26
- Ref2V 展示:H3 模型 15 秒生成复杂提示词效果 — Jeffu · 2026-08-26
- GPT Image 2 神级 Prompt:将日常照片转化为形状翻译海报 — RealJamesOfficial · 2026-08-26