ShadowDancer:用“影子对”教视频世界模型学任意动作
AlayaLab · hf · 2026-07-31
ShadowDancer 提出了一种针对交互式视频世界模型的新方法,实现了对任意动作的帧级精准控制。
- 核心挑战:现有接口对动作编码要么过于松散导致模型即兴发挥,要么依赖难以获取的结构化信号,难以在不同动态间进行泛化。
- 技术创新:
- 影子对:通过独立重采样外观来重播相同的动态,构建大规模视频对,使模型能精准控制具备此类数据的动态家族。
- 交叉影子预测:通过预测一个“影子”来学习动作,从而剥离外观等无关变量,提取统一的动态表征来驱动世界模型。
- 效果:无需动作标签、运动估计器或微调,即可将任意视频片段转化为可在新环境中复用的动作资产。在对比实验中,盲测胜率达 86%。
「多模态」频道最新
- 谷歌开源Glanceboard:用Gemini将日历变成e-ink艺术画 — osanseviero · 2026-07-31
- 开源 Glanceboard:用 Gemini 将日历变成电子墨水屏艺术 — osanseviero · 2026-07-31
- 视频重打光方案速度横评:LTX-LoRA 两分钟出图 — mickmumpitz · 2026-07-31
- MiniMax H3 视频模型登陆 Topview,价格仅为 Seedance 三成 — iamfakhrealam · 2026-07-31
- ComfyUI-LTX-Reframe 节点发布:重构视频画布与音频 — Championship_Better · 2026-07-31
- RTX 3060 跑 LTX2 生成 5 秒视频需 10 分钟,如何优化? — Nicola883 · 2026-07-31