Fizgig 4.0 发布:照片+音频+视频合一训练 Minimax H3
shootthesound · reddit · 2026-08-18
开源训练工具 Fizgig 4.0 发布,主要更新:
- 支持把 Minimax H3 的视频、音频(wav/mp3)和照片训练合并到同一个数据集
- 新增数据集准备工具 Gizmo,简化视频/音频数据集制作
- 引入 turbo 模式,以及 INT8 量化带来的大提速(16GB 显存用户受益,来自社区贡献者 rintic-13)
作者分享的一手经验:H3 参数调对后,纯图像训练不会破坏视频能力;照片+音频组合训练速度非常快,训声音数据集很容易(建议共用触发词)。视频训练也能用,只是慢——如果教模型的内容用照片和音频就能覆盖,就不必上视频;需要捕捉动态时视频才值得。作者次日会发布详细 YouTube 教程。
项目地址:github.com/shootthesound/Fizgig
「多模态」频道最新
- AI 短片《DO NOT WAKE HER》展示视觉效果 — RealisticValuable484 · 2026-08-18
- 实测 MiniMax 角色替换功能:人换人、动物换动物可行 — Alex-edits123 · 2026-08-18
- Qwen-Video-Edit:图像编辑模型直接改视频,无需视频预训练骨干 — qixing_huang · 2026-08-18
- Minimax H3 生成《Doomsday》预告片删减片段 — beatlepol · 2026-08-18
- 利用深度图与对象追踪稳定妻子模型的视频渲染 — alecubudulecu · 2026-08-18
- ComfyUI 中 Minimax H3 无视图片输入,用户求助排查 — magik_koopa990 · 2026-08-18