开源 MiniMax-H3 Ref-V2V 工作流:实现精准局部运动控制
Primary_Internal9365 · reddit · 2026-08-08
为了寻找闭源 API(如 Kling、Gemini)的本地平替,作者基于 MiniMax-H3 模型搭建了参考视频到视频(Ref-V2V)的 ComfyUI 工作流,并开源了自研的控制节点。
核心技术与解决方案:
- 自定义注意力掩码节点:挂载至 DiT 自注意力层,结合 SAM3 实现区域特定控制(如锁定角色运动并替换背景)。
- 32 倍数智能填充:通过动态 Reflect Padding 将输入分辨率向上取整至 32 的倍数,避免粗暴缩放导致的画质损失。
- 17 帧 VAE 同步:自动匹配时间 VAE 的 packing 规则,防止解码崩溃或画面突变。
- 边界漂移修复:采用首尾各填充 15 帧冻结帧的方式,解决模型在视频末尾扭曲动作的问题。
作者还提出了一个待解决的“谜团”:在裁剪填充帧时,不同视频所需的索引偏移量会在 15 和 30 之间波动。目前该工作流已在 RTX 5090 上完成测试,并支持非官方的 4 步 Turbo LoRA 加速。
「编程与Agent」频道最新
- Sourcegraph 分析 51 万次提交,揭示开源圈 AI Agent 代码采用现状 — heyneighbor · 2026-08-08
- 盛大孵化EverMind连发三篇论文,构建自进化AI全栈技术 — 量子位 · 2026-08-08
- AI智能体开发中,领域专家经验至关重要 — rachittshah · 2026-08-08
- 实测通义千问3.8-Max生成游戏:能力比肩GPT-5.6且成本仅四分之一 — rohanpaul_ai · 2026-08-08
- 探讨智能体长周期强化学习:批次大小与梯度更新策略权衡 — ShikharMurty · 2026-08-08
- 蚂蚁集团与人大推出 SearchOS:共享记忆破解搜索智能体死循环 — jiqizhixin · 2026-08-08