把 Minimax H3 当“笨摄影师”:手搓 2 分钟音视频对话
niechta · reddit · 2026-08-09
一位开发者分享了使用 Minimax H3 模型制作 2 分钟对话场景的完整工作流。为了避免单次生成失败,作者将 AI 视作“笨拙的摄影师”,分别生成独立的镜头、覆盖画面和无声反应片段,最后手动剪辑拼接。
核心技术栈与参数:
- 模型与插件:使用 Minimax H3 的 Ref2VA 路径,配合 ComfyUI 0.30 及 ComfyUI-H3-Multishot 和 ComfyUI-GGUF 节点。
- 生成规格:960×544 分辨率,24 fps,模型可一次性生成画面与 32 kHz 立体声。
- 推理参数:20 步,cfg 1.0,使用 resmultistep / simple 采样器和固定种子。
- 硬件耗时:在 RTX PRO 6000 显卡上,生成 362 帧约需 420 秒。
作者指出,由于分辨率限制,单镜头裁切后画质会出现明显的像素化,但整体通过后期处理成功将各片段融合成了一部完整作品。
所属事件:开发者探索MiniMax H3视频生成多样化工作流(6 条相关)→
「多模态」频道最新
- WanGP 一键启动器更新:全面优化本地多模态生成 — cocktailpeanut · 2026-08-09
- MiniMax 图像换脸工作流:结合 Turbo LoRA 实现 4 步生成 — Friendly-Fig-6015 · 2026-08-09
- CVPR 2026 论文开源:PersonaLive 实现直播表情肖像动画生成 — tom_doerr · 2026-08-09
- Grok Imagine新增分层编辑功能 — nima_owji · 2026-08-09
- 实测 Flux 3 模型:生成逼真太空游轮 POV 视频 — fofrAI · 2026-08-09
- ComfyUI 新插件修复 MiniMax H3 视频快速运动伪影 — MatlowAI · 2026-08-09