Caltech DynaTokens 入选 NeurIPS:测试时训练少量 token 教会视频模型动态
georgiagkioxari · x · 2026-09-30
Caltech 的 Ziqi Ma、Hongqiao Chen 与 Georgia Gkioxari 发布 DynaTokens,论文入选 NeurIPS,解决相机可控视频模型「镜头会动、物体不动」的痛点:
- 核心思路:相机控制是全局的(影响每帧每个 patch),而场景动态是局部的(如「狗在跑」只该影响狗的区域)。现有 LoRA、block finetuning、TTT 等全局参数更新方法会把两者耦合,动态监督反而损害相机控制
- 方法:DynaTokens 作为轻量插件,在测试时针对具体场景训练少量可学习 token,把物体运动与相机运动解耦
- 效果:在 HYWP、Lyra-2、Lingbot 等相机控制模型以及专门用合成数据训练动态的 LiveWorld、HyDRA 都难以处理的真实场景动态上胜出,且支持测试时未见过的相机轨迹(WASD 平移+方向键旋转)。
项目页、论文与代码均已公开。
「多模态」频道最新
- 用 Opus 5.5 加 ElevenLabs 把财经人物写成摇滚与说唱 — leveragedupside · 2026-09-30
- 开源视频编辑器 Lumibelle:角色参考资产喂给 MiniMax H3 保持一致性 — rad_reverbererations · 2026-09-30
- Minimax H3 视频外绘求助:9:16 扩到 16:9 画面被改变 — navarisun · 2026-09-30
- Inception 推出 Mercury Voice:扩散式语音模型延迟比 GPT-6 Luna 低一半 — StefanoErmon · 2026-09-30
- ComfyUI-Continuity 更新:角色管理、RefMod 预设与接缝优化 — Okims_kor · 2026-09-30
- AI 把自己的子智能体组成摇滚乐队,本地模型产出首支 MV — WolframRvnwlf · 2026-09-30