MiniMax-H3 推出单文件版,支持 ComfyUI 视频音频生成
marres · reddit · 2026-08-22
作者将 MiniMax-H3 的新变体(Pruned Ref-Delta Fused r1024)转换为原生 ComfyUI 单文件格式。该模型的特点在于,从修剪后的 FL2VA 模型出发,将 Ref2VA 与 FL2VA 差值的秩-1024 近似融合进去,使得工作流只需一个 Transformer 即可实现首尾帧条件控制以及图像/视频/音频参考。这意味着用户可以在无需加载两个独立扩散模型的情况下,获得 MiniMax-H3 原生的同步视频+立体声生成能力。转换已处理 AdaLN、偏置折叠、QKV 融合等技术细节,并测试通过。
「多模态」频道最新
- 使用 Runway 制作的短片《Frack》展示 — AIandDesign · 2026-08-22
- AI 辅助科幻短片《THE WALL》最终集预告 — TheodorPetrenkoFilms · 2026-08-22
- 求助:如何移除视频中的对象或人物 — Glittering-Cold-2981 · 2026-08-22
- LTX-2.5 文本 encoder 推出 NVFP4 版,显存占用降低 — superPussyman · 2026-08-22
- CVPR 2026 口语报告:细粒度负向提问让 MLLM 集体幻觉 — zeynepakata · 2026-08-22
- AI 电影走出 Demo:四周 200 万美元拍出 110 分钟长片 — lmoroney · 2026-08-22