开源全流程复刻 1967 蜘蛛侠片头:MiniMax H3 真人化实战与参数心得
seeker_ktf · reddit · 2026-09-02
作者用 MiniMax H3 参考视频模型,把 1967 年《蜘蛛侠》动画 TV 片头重制为真人版,整条工作流 100% 开源:ComfyUI + RTX 4060 Ti (16GB),0.9 MP 渲染后经 RTX Ultra 放大至 1080p,用 OpenShot 剪辑合成。
踩坑与经验:
- 60 秒片头含约 31 个转场,帧级对齐始终 hit-or-miss,最终拆成 13-14 个片段分别生成再剪辑
- 建议先用 Handbrake 把参考视频统一转 24fps;时间码要写全数字(00:03.500 ≠ 00:3.5)
- 为每个角色做 character sheet 保持一致性;crossfade 交给剪辑软件而非模型
- 用 VHS loader 做帧精确的起止点加载,一个输入文件喂所有片段
- 用表格记录每个镜头的起始帧、帧数、文件名
- 参数:先 0.2-0.3 MP + speed LoRA + 8 次迭代定节奏,再用 0.9 MP + 20 次迭代 + dpmpp2m 出成品;minimaxh3turbo LoRA 用 8 次迭代,因为 sigma step 过大时参考图会在片段中途“失效”
- 低清测试跑的帧可拉出来当参考帧,MiMo/MiMax 对这种“轻推”很买账
「多模态」频道最新
- WeMM-Embedding 登顶 MMEB-v3:9B 得 59.5 分,2B 超 7B/8B 模型 — tomaarsen · 2026-09-02
- MMEB-v2 实测:WeMM-2B 以四分之一体积胜过 Qwen3-VL-Embedding-8B — tomaarsen · 2026-09-02
- 视频检索差距最大:WeMM-2B 在 MMEB-v2 视频子集超 8B 达 3.7 分 — tomaarsen · 2026-09-02
- 腾讯开源 WeMM-Embedding:文本图像视频统一嵌入,Apache 2.0 — tomaarsen · 2026-09-02
- 两段式 latent 放大工作流里 LoRA 该接在哪一段? — joseph_jojo_shabadoo · 2026-09-02
- MiniMax H3 768x 唱歌口型半数翻车脸融化 — PersonalityLimp2593 · 2026-09-02