GEAR 用几何作地址路由注意力,实现分钟级相机控制视频生成
Zesong Yang · hf · 2026-09-30
Hugging Face 论文 GEAR 提出以几何作为视觉记忆的显式地址来路由注意力,解决长时程相机控制视频生成中的历史内容召回难题。
- 核心洞察:几何无需解释场景内容,只需决定从视觉记忆的哪里读取,注意力机制再决定恢复什么。
- 方法设计:不做全局 3D 融合,保留帧级 latent,用逐帧几何建立与目标视角的 token 级对应;Geometric Correspondence Attention(GCA)在去噪过程中选择性注入几何匹配的历史特征。
- Invisible Octree:累积可见性证据,剔除几何上成立但实际被遮挡的错误对应,避免误差累积。
- 效果:在视觉质量、相机控制精度与回访一致性上达到 SOTA,支持沿复杂轨迹生成分钟级长视频。
「多模态」频道最新
- 用 Opus 5.5 加 ElevenLabs 把财经人物写成摇滚与说唱 — leveragedupside · 2026-09-30
- 开源视频编辑器 Lumibelle:角色参考资产喂给 MiniMax H3 保持一致性 — rad_reverbererations · 2026-09-30
- Minimax H3 视频外绘求助:9:16 扩到 16:9 画面被改变 — navarisun · 2026-09-30
- Inception 推出 Mercury Voice:扩散式语音模型延迟比 GPT-6 Luna 低一半 — StefanoErmon · 2026-09-30
- ComfyUI-Continuity 更新:角色管理、RefMod 预设与接缝优化 — Okims_kor · 2026-09-30
- AI 把自己的子智能体组成摇滚乐队,本地模型产出首支 MV — WolframRvnwlf · 2026-09-30