免训练给冻结视频世界模型加上灵活镜头与时间控制
Chenxi Song · hf · 2026-09-11
World in World 提出一个 training-free 接口,让冻结的自回归视频世界模型获得灵活的相机与时间控制:通过原生自注意力路由异构视觉证据,结合对应引导查询(correspondence-guided queries)与逐通道注意力引导实现,无需微调模型。
「多模态」频道最新
- Meta Muse 新玩法:一键把任意文章变成播客收听 — alexandr_wang · 2026-09-11
- GPT-6 Astra 做 3D 实战:硬表面走 Blender MCP,有机体靠 TripoAI — majidmanzarpour · 2026-09-11
- 回望扩散模型之前:VQGAN,生成式视觉的奠基之作 — makeitrad1 · 2026-09-11
- 社区开发者做 ComfyUI 节点,为 MiniMax H3 提供 3D 灯光棚重打光 — Emotional_Example_12 · 2026-09-11
- 5090 上 125 秒生成 10 秒 1MP 视频,作者分享深度优化工作流 — Tokyo_Jab · 2026-09-11
- Seedance 2.5 生成 30 秒超写实首尔日常视频,完整提示词公开 — SimplyAnnisa · 2026-09-11