Viggle 开源视频角色替换模型:一帧重绘替代整套姿态管线
cocktailpeanut · x · 2026-09-05
- Viggle 发布首个开源权重模型 Viggle-Animate,基于 MiniMax-H3 的 ref2va transformer 做 33.1B 全量微调,并用 DMD 蒸馏到仅 3 次前向传播,单 GPU 26 秒生成 5 秒视频。
- 用法极简:把视频中的一帧在任意图像编辑器里重绘成新角色,模型负责把这次编辑传播到整段视频,保持动作、镜头与时间轴不变。
- 核心创新在于抛弃传统管线:不做姿态骨架估计、分割 mask、人脸跟踪,也不用文本 prompt 或身份编码器。参考帧本身就携带了与原片一致的姿态、镜头、构图和光照,无需下游再对齐。
- 效果最强的场景恰是最难替换的:快速运动(甩头、全踢腿、跳跃)能逐帧精确跟随而非糊化。
- 评论区指出这可能是工作流「解绑」趋势的信号:把姿态检测、分割等重活外包给外部图像编辑器只处理单帧,模型因此可以做得很快——以 finetune 形式实现的工作流创新。
「多模态」频道最新
- Reddit 分享 AI 短片《Ishiro - The Last Blade》 — Nervous-Barnacle-888 · 2026-09-05
- 开发者呼吁:给 MiniMax H3 做微调,让留白处自动补真人语气词 — cocktailpeanut · 2026-09-05
- Nvidia DLSS 5 帧插值在 Stable Diffusion 社区引热议 — KonoTheSavage1 · 2026-09-05
- Perceptron Multilook API:一次预填视频上下文,成本降至 32% — AkshatS07 · 2026-09-05
- SDXL 角色 LoRA 防脸崩:加 Face Detailer 收尾最有效 — petranova_ · 2026-09-05
- 开发者将 NVIDIA DLSS 接入 ComfyUI,开源三个节点 — KonoTheSavage1 · 2026-09-05