NAMVIS:自回归替代扩散做稀疏视图多视图合成,快 3 倍
Ramil Khafizov · hf · 2026-10-08
- 问题:稀疏视图新视角合成是 3D 内容创作的核心问题,扩散模型因迭代去噪导致推理成本高。
- 方法:提出 NAMVIS,免扩散框架,把多视图合成重新表述为几何条件下的 next-scale 自回归,通过少量粗到细尺度步预测离散视觉 token,尺度内和跨视图并行采样。
- 几何锚定:提出 Multi-scale Projective Pose Encoding,在每个分辨率将源/目标相机变换注入自注意力和跨注意力;结合全局条件与稠密几何感知交叉注意力,保证源视图外观保持与目标视图一致性。
- 结果:在 Objaverse、GSO、OmniObject3D 上,PSNR/SSIM/LPIPS 均超过扩散基线,速度快 3 倍以上。
「多模态」频道最新
- 用 --sref 油画风格生成「1765 年吃冰淇淋冠军」名场面 — dolma33 · 2026-10-08
- 网友用 WAN 3.0 制作迷你动画剧集短片 — tonimestudio · 2026-10-08
- Synthesia 推出 Syren:一条提示生成 $20000 级品牌视频,成本仅 $5 — nikola_mr64990 · 2026-10-08
- obvmp 版 Minimax H3 工作流实测:3090 上 10 秒片段约 2 分钟 — fa6637 · 2026-10-08
- 浏览器端免费工具:从 AI 视频精确提取逐帧关键帧 — QuietPound6205 · 2026-10-08
- Drama 推出 AI 模型:成片拍完后可单独修改演员情绪 — nikola_mr64990 · 2026-10-08