专题 · FULL STORY

MiniMax H3:实时生成、开源与争议四天

Ethan Mollick 实测发现 MiniMax H3 Max 视频生成已快于观看速度,随后 MiniMax 开源 H3 模型并联合多方推出 FastH3 加速方案。开发者实测确认速度与画质,但社区围绕 FastH3 质量差距与发布伦理展开激烈争论。

2026-08-28 ~ 2026-08-29 · 4 集 · 23 条

第 1 集 · MiniMax H3 Max 视频生成快于观看速度,AI 视频迈入实时时代(2026-08-28,4 条)

Ethan Mollick 实测发现,MiniMax 的 H3 Max 视频生成模型跨过关键技术里程碑:仅通过网页界面,从点击生成到完成所需时间已短于观看该视频的时长,且质量合理。开发者还将其做成交互式应用,可根据聊天输入的提示词实时生成视频。这标志着 AI 视频生成正式进入实时甚至超实时时代,为实时交互式内容创作打开了大门。

第 2 集 · MiniMax 开源 H3,FastH3 加速近实时生成(2026-08-29,10 条)

MiniMax 于 08-29 发布开源视频生成模型 H3,并联合 Hao AI Lab、NVIDIA、FastVideo、Nuvalab 等推出加速方案 FastH3 V1,在 NVIDIA Blackwell GPU 上最高提速 14 倍,4 张 B200 可实现近乎实时的视频生成;模型权重、训练代码与部署指南全部开源。这是视频生成从云端排队走向本地实时交互方向的代表性进展,部署门槛被显著降低。

已确认

  • 性能:13 秒生成 15 秒 768p 视频;在 NVIDIA Blackwell GPU 上最高提速 14 倍
  • 硬件表现:单张 B200 生成 15 秒视频需 47 秒,宣称 3 倍实时因子;4 张 B200 可实现近乎实时的生成速度;@ricklamers 补充在 8xB200 上实测 12.88 秒完成生成,优于实时阈值
  • 功能:支持文生视频与音频同步,完全开源并提供训练代码与部署指南;原生支持可变分辨率、宽高比和时长
  • 技术细节:FastH3 V1 是 MiniMax H3 的 4 步稀疏蒸馏 Checkpoint 与 LoRA,使用 1000+ B200 训练小时;采用 90% 稀疏度的 Data-Free DMD2 与 VSA-H3 技术蒸馏,通过 4 次前向传播同步生成视频与音频;默认配置需 4 张 B200;针对 NVIDIA Blackwell 架构优化,与 FastVideo、Nuvalab 合作并结合 FastGen 技术,VSA 版本需 VSA kernel;训练结合真实世界多模态输入分布以保持质量

尚未确认

  • 官方提及的后续计划(Omni ref 支持、NVFP4 量化)尚在路线图中,具体发布时间未定
  • RTX 消费级显卡的支持情况在帖子中未给出明确结论

为什么重要

  • 单 GPU 级别的近实时视频生成显著降低了视频模型的部署门槛,开源权重与训练代码让研究者和开发者可以本地复现与二次开发
  • 多方(MiniMax、Hao AI Lab、NVIDIA)协作推进推理加速,显示视频生成正从云端排队走向本地实时交互方向

第 3 集 · 实测 MiniMax H3 Max:速度极快且画质与原版持平(2026-08-29,2 条)

开发者对原版 MiniMax H3 与 fal 后训练的 H3 Max 进行实测对比:使用相同提示词生成 15 秒游戏广告视频,H3 Max 生成 768p 视频仅耗时 18 秒,而 Seedance 2.5 生成 1080p、15 秒视频耗时 4 分钟以上。结果显示 H3 Max 生成速度极快,且画质与原版差异不大,被认为具有明显性价比优势。

第 4 集 · FastH3 生成质量争议:实测差距与发布伦理激辩(2026-08-29,7 条)

围绕 MiniMax H3 的 FastH3 快速生成模式,社区爆发质量与发布伦理争议。isidentical 基于官方 specs 实现了原版 H3 并与 FastH3 对比,发现两者存在肉眼可见的质量差距,原版明显更好,部分 FastH3 输出甚至接近随机像素,令人不解官方为何会在未察觉的情况下发布降级版本。isidentical 进一步批评 fastH3 项目以欺骗性结果利用开源热度,未诚实标注质量劣化,是在制造虚假希望;作者一方回应称受限于算力,但坚称模型可用。

已确认

  • isidentical 实测原版 H3(基于官方 specs 实现)与 FastH3 存在明显质量差异,原版更好
  • Reddit 用户 rmrfallfiles 的对比则认为 FastH3 在 12GB 显存上生成的质量可对标 25 步 ComfyUI 工作流,但其中 FastH3 样片直接取自官方博客,默认工作流在 20 步基础上加到 25 步并加入 SLA + S 等额外设置
  • FastH3 作者回应称受限于算力,但坚称模型可用

尚未确认

  • FastH3 与原版 H3 的真实质量差距究竟多大:不同评测者结论相反,Reddit 对比中的样片来源与工作流设置差异较大,结论难以直接采信
  • MiniMax 官方是否知晓并在后续修正该降级问题,材料中无相关信息

为什么重要

  • Fal 工程师 jfischoff 指出社区中部分模型优化「唯速度论」,声称比原模型快数倍但输出质量已完全失真,本质如同生成随机像素;他透露图像/视频模型极难优化,团队花在评测和保证优化正确性的时间是内核工程的 2-3 倍
  • isidentical 强调质量优先的发布伦理:不发布未成熟 checkpoint 就宣称突破,不为追求 0.25 秒极速生成而用稀疏注意力牺牲质量,并强调团队在训练、RL 基建、数据 curated 及 kernel 精度一致性上的投入,批评业界「YOLO 式」粗制滥造风气
  • 该事件凸显开源视频模型在速度优化热潮下,评测严谨性与诚实标注质量劣化的必要性