LEGO:免提升管线从第三人称视频生成第一人称视频,SOTA
25frms · hf · 2026-10-09
- 任务:从单个第三人称(exocentric)录像生成第一人称(egocentric)视频——两视角重叠极少,大部分目标视角不可观测,是困难的 novel view synthesis。
- 现有 SOTA 依赖显式管线(估深度→点云提升→重投影条件化视频扩散),深度误差会直接变成内容错位。LEGO 提出免提升(lifting-free)方案:用 LVSM 风格 transformer 微调出的学习型视角合成器,不经深度/点云直接渲染第一人称视角,在内部解决跨视角对应。
- 关键论证:概率式映射按学习到的对应分布平均候选源位置,牺牲细纹理但保结构——恰好适合扩散模型(其去噪训练擅长恢复细节),条件应优先结构对齐而非锐度;分布集中度还提供逐区域置信度,用于掩蔽低置信区域并在早期去噪步骤引导生成。
- 结果:一致超过显式 SOTA 管线,并可零重训泛化到其他数据集。
「多模态」频道最新
- LMArena 后训练配方:偏好+细则奖励组合,Flux2dev Elo 提升 69 分 — lmarena-ai · 2026-10-09
- TerraVis:用 MLLM 工作流量化文生图的「世界一致性」缺陷 — the-aiml · 2026-10-09
- 听声音就能认出 Opus 生成的视频,音画同步节奏成新指纹 — hudzah · 2026-10-09
- 孙悟空骑虎下山:AI 视频再现《大圣归来》级国风名场面 — lucky-plume · 2026-10-09
- 自回归检索器 ARR:用已检索条目反馈迭代优化查询理解 — _reachsumit · 2026-10-09
- 索尼 Syn-Omni:共享 LoRA 加模态专家路径,81 项任务领先全模态嵌入基线 — _reachsumit · 2026-10-09