专题 · FULL STORY

MiniMax H3视频模型:从开源到实测

MiniMax 开源原生 2K 视频生成模型 H3,凭借高连贯性迅速引发社区实测热潮。开发者证实其能在 16G 显存等消费级硬件上本地运行,并涌现大量高级工作流,其多模态与复杂运镜能力惊艳海内外。

2026-08-09 ~ 2026-08-13 · 4 集 · 33 条

第 1 集 · MiniMax开源H3视频模型,2K长视频本地可跑(2026-08-09,16 条)

MiniMax 最新开源了原生 2K 视频生成模型 H3(疑似内部代号 H3 ref2va),凭借极高的生成质量与连贯性迅速引发 AI 社区的实测热潮。当前结论显示,该模型不仅能生成长视频、处理复杂的物理交互,还能在本地端侧流畅运行,标志着多模态视频生成赛道迎来了一位强有力的竞争者。

已确认

  • 核心性能与开源:模型支持原生 2K 分辨率生成,画面细节与连贯性极佳。开发者 ostrisai 为测试该模型生成了 1000 条覆盖广泛主题的视频,并将这 1.5 小时的生成结果作为开源数据集提供下载。
  • 本地部署与长视频:用户 singularitynotnow 实测确认,模型可在本地单次生成 30 秒无剪辑视频。在 1024x576 分辨率下耗时 6 分 46 秒,消耗 288GB 显存,并使用了 NVIDIA Sol-Attn 加速方案。Pixio 团队也证实其突破了 15 秒的时长限制,且生成速度快、提示词连贯性好。
  • 多场景创作能力:物理交互方面,FDosha 展示了极具真实感的重力操控场景;风格化方面,lazyspock 使用超长提示词精准生成了《南方公园》风格的 2D 动画,Co-OB 制作了德克斯特大战灭霸的动画;此外,在微距创意(umeshai)、宏大宇宙光影(Candiru666)等场景中均表现优异。
  • 工作流兼容性:jdude 实测发现,H3 能够对非 H3 模型生成的视频片段进行无缝续写,为创作者混合使用不同视频模型提供了新工作流。TheruleofThetra 则通过拼接三个生成视频并使用 RIFE 算法补帧至 96 FPS,实现了高帧率大片效果。

为什么重要

  • 端侧与开源生态:MiniMax H3 的高质量开源权重允许开发者在本地运行(如 Co-OB 在 RTX 3080 显卡上进行测试),大幅降低了高水准 AI 视频创作的门槛,直接赋能独立创作者与开源社区。
  • 多模态竞争力:该模型在长视频生成、复杂提示词理解和多风格渲染上的突破,证明了其在当前竞争激烈的多模态视频赛道中具备顶尖实力,为影视、动画及网络迷因创作提供了全新的生产力工具。

第 2 集 · MiniMax H3 本地实测:16G显存生成24分钟2K视频(2026-08-09,12 条)

近期社区针对 MiniMax H3 视频生成模型展开了大量实测,证实了其在消费级硬件上的本地运行能力与极高的可控性,涌现了多种高级工作流。

已确认

  • 本地长视频生成:开发者成功在单张 RTX 5060 Ti(16GB 显存)上本地运行该模型。通过 NVFP4 量化与 lightx2v Turbo LoRA(仅需 8 步迭代)结合 Sol Attention 机制,不仅生成了 Brad Pitt 说话视频,还完成了长达 24.4 分钟的 2K(2048x1152)原生视频,以及包含 36 个镜头、时长 2 分 47 秒的苏格拉底主题微纪录片。
  • 高级运镜与场景控制:多位用户验证了模型的精准控制能力。@HeftySide7892 利用 L2VA 功能通过结构化提示词,成功还原了连贯的“登月片场”并定格于指定参考图;@LanceCampeau 分享了 FFLF 工作流,可通过基础路径提示词精准控制虚拟摄像机运动;@TinyTeam2511 与 @Candiru666 的测试也表明,模型在商业广告和复杂特写镜头中展现了惊艳的电影级质感。
  • 视频编辑工作流:@AltruisticTax1317 展示了基于 SAM 区域分割的局部重绘与背景替换流程。尽管音视频底层耦合导致精确的潜空间遮罩较为困难,但已有开发者在 GitHub 上提出了解决方案。

尚未确认

  • 动态物理规律表现:@BestCandidate9060 在 15 秒测试中指出,模型静态画面下的角色与材质非常扎实,但动态画面中火焰等物理运动表现不够自然,镜头切换的连续性仍需提升。这表明模型在复杂物理交互的稳定性上仍有优化空间。

为什么重要

MiniMax H3 的这批实测证明了高端 AI 视频生成正在向消费级本地设备下沉。创作者不仅能在 16GB 显存的显卡上跑通模型,还能实现长达数十分钟的 2K 视频生成、精准的虚拟运镜以及局部重绘。这大幅降低了电影级质感视频与商业广告制作的门槛,标志着 AI 视频生成从单纯的“出图效果展示”迈向了高度可控的工业化工作流阶段。

第 3 集 · MiniMax 发布 H3 多模态视频模型并支持 ComfyUI(2026-08-10,2 条)

MiniMax 发布了全新的开源多模态视频模型 H3。该模型具备强大的跨模态处理能力,能够同时解析并处理文本、图像、视频和音频等多种数据类型,支持联合生成视觉与音频内容。目前 H3 已上线 ComfyUI,用户可借此进行文生视频、图生视频、首尾帧生成等创作,并能实现 15 秒 768p 分辨率的视频生成。

第 4 集 · MiniMax视频生成模型实测惊艳海外开发者(2026-08-12,3 条)

MiniMax 最新推出的视频生成模型引发海外开发者热议。实测显示,其 R2V、H3 及 ref2va 等模型在长视频生成、复杂运镜、场景理解和逻辑推理方面表现惊人,且生成速度极快、失败率仅约 5%。多位网友直言其综合表现已超越字节的 Seedance 模型,成为 AI 视频生成领域的新黑马。