VGGT-Diff:几何路由扩散模型实现稀疏视角新视角合成
XPENG-AI · hf · 2026-09-29
新视角合成(NVS)面临两难:重建方法保几何但难以合成未见区域,扩散方法生成先验强却依赖隐式对应关系。VGGT-Diff 将 VGGT-Ω 的视觉几何潜变量路由进预训练视频扩散模型:
- 每个 token 关联 3D 点与置信度,经置信度感知的 Visual Geometry Router 转为查询对齐的条件,保留前后表面证据
- Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化,提升多视角稳定性
- 结合训练期正则与推理期引导的鲁棒几何条件
- 在不同视角难度下的插值与外推任务上取得有竞争力或 SOTA 的表现,代码已开源
「多模态」频道最新
- 一条提示词无剪辑出片,Kling 4.0 真实感逼近实拍 — FinanceYF5 · 2026-09-29
- 一条提示词无剪辑出片,Kling 4.0 真实感逼近实拍 — FinanceYF5 · 2026-09-29
- 零素材纯代码造城:数千高塔与实时合成音轨的赛博朋克 — techartist_ · 2026-09-29
- 让扩散模型故意塌缩:从预训练权重中提取人群图谱 — kwangmoo_yi · 2026-09-29
- EvolvingAvatar:测试时训练让 3D 数字人头随对话进行越用越像你 — HFUT-AI · 2026-09-29
- SciGen-Verifier 用可解释推理验证 AI 生成的科学图像 — Jiali Chen · 2026-09-29