专题 · FULL STORY

MiniMax H3:从官宣开源到实测登顶

MiniMax全模态模型H3经历了从即将开源的预热,到正式发布并登顶视频编辑榜单的全过程。实测表明,该模型凭借原生2K双声道音视频生成能力惊艳众人,且大幅降低了部署与生成成本,获得ComfyUI等平台首发支持。

2026-07-30 ~ 2026-08-03 · 13 集 · 146 条

第 1 集 · MiniMax H3 视频模型实测:原生2K画质与商业级质感惊艳(2026-07-30,59 条)

MiniMax(海螺AI)最新一代视频生成模型H3已开启早期测试,多位创作者和开发者的实测表明,该模型在多项指标上达到行业顶尖水平,其实力被认为比肩甚至超越Seedance 2.0,展现出极高的商业应用价值。

已确认

  • 核心规格:H3模型单次生成视频最长15秒,原生分辨率最高2560×1440(2K)。作为全能模型,支持最多12个跨模态参考素材输入(涵盖图像、音频、视频等,单个素材最长15秒)。
  • 多模态生成:引入全新Omni Reference工作流,打破传统视频模型仅依赖文本的限制。用户可组合产品图、参考视频和音频等多种模态进行生成,甚至仅凭5张静态图就能生成连贯短片或影视片头。
  • 生成能力:多位创作者实测证实,H3具备极佳的复杂提示词理解能力,能精准执行包含复杂空间变换的运镜指令(如一镜到底极速穿梭)。模型在物理运动自然度、动作连贯性、文字渲染清晰度以及高保真语音与口型同步方面表现扎实。此外,它能将画面的色彩、光影与构图意图融入生成逻辑,而非机械还原元素。

为什么重要

  • 重塑商业片质感:在同等提示词测试下,多位评测者指出H3生成的成片在产品交互动态感、画面过渡流畅度及整体叙事节奏上超越了Seedance 2.0,质感非常接近高水准商业广告。
  • 创作工作流革新:H3能够完美分离视频背景与人物进行替换,且支持无后期直出。这种将多模态参考、高质量直出与极低门槛结合的特性,使其成为极具实用价值的AI视频工具。

还有 39 条相关讨论 →

第 2 集 · Google Gemini 视频生成与编辑功能限时免费开放(2026-07-30,3 条)

Google 宣布即日起至 2026 年 8 月 4 日,非订阅用户也可在 Gemini 应用内免费创建最多 10 个视频。除了基础的视频生成功能,官方还同步推出了 Gemini Omni 视频编辑工具。该工具支持物体替换、添加主体以及空间互动等高级编辑操作,为用户提供了更丰富的视频创作体验。

第 3 集 · MiniMax发布全模态模型H3,支持2K原生双声道视频(2026-07-30,18 条)

MiniMax正式发布全模态生成模型H3,该模型统一了文本、图像、视频和声音的理解与生成能力,支持原生双声道音频输出,最高可生成15秒2K分辨率(24fps)的视频。H3已上线海螺AI网页端、MiniMax API以及fal、Topview等平台,并即将以开放权重形式开源。其极具竞争力的定价(低于主流模型三分之一)引发了社区关注。

已确认

  • 多模态与输出规格:H3支持多模态上下文理解,可直接输出带有原生立体声、最高15秒2K分辨率(24fps)的视频,具备商业级可用的画面质感。作者@量子位指出,该模型打破了传统视频模型仅生成素材的局限,将剪辑逻辑、字体排版、转场设计、背景音乐及视觉特效端到端集成,可直接输出2K成片。
  • 12项资产参考(12-Asset Reference):允许用户组合多达9张图片、3个视频片段和3个音频片段作为参考,从而精准锁定角色形象、运动轨迹与音频特征。
  • 商业级能力:在精确文本与品牌信息渲染、视频到视频动作迁移(V2V Motion Transfer)等方面表现出色,主要面向广告和电商等商业场景。
  • 平台与定价:模型已上线fal、Topview平台与海螺AI。据作者@赛博禅心透露,其API价格低于主流模型的三分之一;作者@angrypenguinPNG也指出其成本仅为一小部分,功能可媲美Seedance。

尚未确认

  • 开源细节与时间:官方及多位创作者确认该模型即将开源,但具体时间表尚未完全敲定。作者@cocktailpeanut提到,官方表示将在未来几天内“遵守法律法规”开放权重,部分网友因等待开源进度而吐槽催促直接放上BitTorrent。

为什么重要

H3的发布标志着视频生成模型在多模态融合上的进一步成熟。原生立体声音频与高质量2K画面的结合,配合精细的多素材参考控制功能,大幅降低了商业视频制作的门槛。同时,其具有竞争力的定价策略以及即将开源的举措,有望在当前的AI视频生成市场中快速抢占份额。

第 4 集 · MiniMax H3模型将发布并开源,视频生成与多模态能力引热议(2026-07-30,7 条)

MiniMax 官方在 Hugging Face 平台透露,新一代模型 H3 即将发布,且权重很快会开源。官方账号同时展示了基于 H3 在海螺 AI 平台上的生成效果,引发社区惊叹。早期测试显示,H3 视频模型支持原生 2560×1440 (2K) 分辨率与长达 15 秒的视频生成,且完全由模型直出无后期剪辑;同时,H3 主打原生多模态理解,允许用户自由组合最多 12 个参考素材(视频、文本、图像和音频混合搭配)。社区讨论指出,如果 H3 能在 ComfyUI 等本地环境中以 RTX 3060 级别显卡运行,将极大造福算力贫乏的开发者。此外,MiniMax 的 Hugging Face 主页还更新了 M3 模型信息,展示了其在稀疏注意力和数学证明生成方面的能力。

已确认

  • MiniMax 官方在 Hugging Face 平台透露,H3 模型即将推出且权重很快会开源。
  • 官方账号展示了基于 H3 模型在海螺 AI 平台上的实际生成效果,引发社区惊叹。
  • 同步曝光的还有 MiniMax M3 模型的相关信息,展示了其在稀疏注意力和数学证明生成方面的能力。

尚未确认

  • 视频模型规格:据早期体验反馈,H3 视频模型支持原生 2560×1440 (2K) 分辨率与长达 15 秒的视频生成,且完全由模型直出无后期剪辑。
  • 原生多模态能力:有开发者测试称,H3 主打原生多模态理解,允许用户自由组合最多 12 个参考素材(支持视频、文本、图像和音频混合搭配)。
  • 生成效果:测试者使用极简提示词便生成了极具电影感的画面,动漫风格动画生成表现惊艳。

为什么重要

  • 如果 H3 能够在 ComfyUI 等本地环境中以 RTX 3060 级别显卡运行,将极大造福算力贫乏的开发者,降低技术门槛。
  • 其强大的多模态混合输入能力,被视为在多模态领域对标行业前沿的重要一步。

第 5 集 · Gemini Omni重塑视频生成与编辑工作流(2026-07-30,3 条)

谷歌Flow工作室集成Gemini Omni模型,正通过自然语言交互重塑视频创作工作流。用户只需输入文本提示词即可完成多种复杂操作,具体应用场景涵盖图生视频、一键转换背景风格,甚至能为无声视频自动配音并匹配人物动作。这些被挖掘出的七大实用玩法,充分展示了该模型在降低视频编辑门槛和提升创作效率方面的巨大潜力。

第 6 集 · MiniMax H3登顶视频编辑榜,宣布开源权重(2026-07-31,7 条)

据 Artificial Analysis 最新评测数据,MiniMax 最新视频模型 H3 在含音频的视频编辑类别中与 Google Gemini Omni Flash 并列第一(Elo 1130 vs 1121),文生视频(含音频)位列全球第二,图生视频跻身前三。MiniMax 官方已确认计划以社区许可证发布该模型权重,使其成为目前领先的视频模型中少有的宣布开源的产品。

已确认

  • Artificial Analysis 视频编辑排行榜(含音频)中,MiniMax-H3(开源)与 Google Gemini Omni Flash 以微弱优势并列第一(Elo 1130 vs 1121)
  • 文生视频(含音频)并列全球第二,图生视频位列前三
  • 模型支持多模态输入,可生成带原生音频的 5-15 秒 24fps 片段
  • 模型支持原生 2K 分辨率与立体声生成,并提供丰富的视频编辑功能
  • 2K 视频定价为 7.8 美元
  • MiniMax 官方确认计划以社区许可证发布该模型权重

为什么重要

  • H3 是目前领先的视频模型中少有的宣布开源权重的产品,可能降低视频生成领域的使用门槛
  • 视频原生编辑能力打破了仅从零生成的限制,支持直接输入文本、图像等素材进行编辑
  • 2K 视频 7.8 美元的定价低于多数竞品,可能对商业应用产生吸引力

第 7 集 · Topview上线MiniMax H3,价格仅为Seedance三成(2026-07-31,9 条)

视频创作平台Topview宣布与MiniMax(海螺AI)达成合作,正式上线MiniMax H3视频生成模型,成为全球首批集成该模型的平台。新模型主打原生多模态输入与高分辨率输出,且定价极具破坏力,旨在为高产能创作者提供更具性价比的选择。

已确认

  • 要点 MiniMax H3支持原生2K分辨率输出,单次可生成最长15秒的视频片段。
  • 要点 该模型能够同时理解文本、图像、音频和视频,实现跨模态的创意控制与原生音视频输出。
  • 要点 在定价方面,H3的使用成本比Seedance 2.0低70%,即价格仅为后者的30%。
  • 要点 Topview为Ultra年度用户提供了专属福利,可享受60天无限次生成。

为什么重要

  • 要点 此次Topview接入MiniMax H3,为创作者提供了一个在分辨率和时长上表现不错,且成本大幅低于竞品的新选项,有望显著降低高质量视频创作的门槛与开销。

第 8 集 · MiniMax H3视频模型即将发布,ComfyUI工作流已抢先可用(2026-08-01,2 条)

开源视频模型即将迎来重大突破,MiniMax H3 模型即将发布。目前,ComfyUI 团队已对该模型进行了深度优化,使其能够在普通的消费级硬件上流畅运行。此外,已有 Reddit 网友分享了该模型在 ComfyUI 中的工作流,该工作流目前已在特定运行节点中开放使用,方便用户提前体验。

第 9 集 · MiniMax H3视频模型实测:2K画质与多镜头一致性惊艳(2026-08-01,12 条)

MiniMax 即将开源的新一代视频生成模型 H3 已进入早期测试阶段,多位创作者通过 Magnific 平台进行了抢先实测。综合反馈,该模型在复杂动态指令执行、多镜头视觉一致性及动作捕捉方面表现突出,且审查机制极为宽松,生成成本仅为同类模型的四分之一,预计将成为视频生成领域的一款强力竞品。

已确认

  • 核心参数方面,H3 作为全能模型支持最长 15 秒的视频生成,原生分辨率达到 2560 × 1440(2K 级别),支持原生双声道,并能同时理解混合的图、视频和音频参考素材。
  • 创作者 @Neggy5 指出,H3 的文生视频画质略显模糊,但动作捕捉非常精准,图生视频在 2K 分辨率下表现极佳,且模型几乎无内容审查限制。
  • 创作者 @umeshai 测试表明,该模型能精准理解并执行高度结构化的创意指令,在动态图形设计、复杂排版运镜以及节奏把控方面表现优异。推主 @卡尔的AI沃茨 也对其特效呈现和文字稳定性表示惊艳。
  • 开发者 @gerardsans 使用 H3 制作了一段游戏风格序列动画,称赞其全参考能力能在不同镜头和快速转场中保持视觉风格的高度一致性,呈现出真实游戏预告片的质感。
  • 创作者 @LudovicCreator 展示了基于静态海报生成动画的 demo,认为该模型在动画创作方面提供了出色的可能性。
  • 推主 @mhdfaran 测试了模型生成复杂长镜头的能力,在包含古庙、发光神器、石头巨人和快速逃生等元素的连贯场景中,人物形象、摄像机运动、光影、水面效果和音频完美契合于同一世界观,多帧一致性惊人。
  • 模型已确认可通过 Magnific 平台运行测试,并有开发者将其与 Grok 的图生视频对口型效果进行了直观对比。
  • 在横向对比方面,创作者 @Brojakhoeman 和 @evereveron78 分别使用相同的赛博朋克风格等复杂运镜提示词,将 H3 与 LTX 2.3 以及 WAN 模型进行了生成效果的对比测试。

为什么重要

  • MiniMax H3 展现出了对复杂创意指令和高级运镜的精准驾驭能力,特别是在多镜头一致性上的突破,直击当前 AI 视频生成的核心痛点。此外,其几乎无审查的特点、极低的生成成本以及即将开源的预期,对创作者具有极高的吸引力。

第 10 集 · ComfyUI 首发支持 MiniMax H3,显存暴降 66% 可跑 RTX 3060(2026-08-01,8 条)

ComfyUI 官方宣布为最新开源的 MiniMax H3 视频模型提供 Day 0 原生支持,通过深度优化大幅降低了该模型在消费级硬件上的部署门槛,使其能够在普通个人电脑上流畅运行。核心团队耗时数月优化,使显存占用暴降 66%,单卡 24GB 显存即可运行,甚至 RTX 3060 配合 32GB 内存也能顺利跑通。社区实测在 RTX 3060 上使用 8-bit 权重生成 832x480 分辨率的 124 帧视频耗时不到 10 分钟,核心团队也成功在消费级显卡上生成了 1080p 分辨率、25 秒时长的视频。该模型支持文生视频、图生视频及视频编辑,最高可生成 2K 分辨率、15 秒带立体声音频的片段。目前已有对应的 ComfyUI 节点库,RunningHub 版本的模型已登陆 Hugging Face,支持图/音/视频到视频+音频的生成(如 T2VA, Ref2VA 等)。此外,MiniMax H3 还获得了 lmsysorg 的 Day 0 支持,并上线 SGLang Diffusion,支持文本、图像、视频和音频多模态输入,可生成原生 2K 分辨率、24fps 且带立体声的 5-15 秒短片,开发者可使用 2x RTX 5090 或 1 块 RTX 6000 显卡本地部署。

已确认

  • 硬件要求暴降:ComfyUI 核心团队耗时数月进行优化,使模型显存占用暴降 66%。目前单卡 24GB 显存即可运行,甚至 RTX 3060 显卡配合 32GB 内存也能顺利跑通。
  • 消费级性能优异:据社区开发者实测,在 RTX 3060 环境下使用 8-bit 权重,生成 832x480 分辨率的 124 帧视频耗时不到 10 分钟。核心团队也成功在消费级显卡上生成了 1080p 分辨率、25 秒时长的视频。
  • 多模态生成能力:该模型支持文生视频、图生视频及视频编辑,最高可生成 2K 分辨率、15秒带立体声音频的片段。目前 RunningHub 版本的模型已登陆 Hugging Face,支持图/音/视频到视频+音频的生成(如 T2VA, Ref2VA 等)。
  • 生态支持完善:目前已有对应的 ComfyUI 节点库可供开发者使用。
  • 其他平台支持:MiniMax H3 已获得 lmsysorg 的 Day 0 支持,并上线 SGLang Diffusion,支持多模态输入,可生成原生 2K 分辨率、24fps 且带立体声的 5-15 秒短片。

尚未确认

  • 关于模型在 SGLang 上的具体性能表现(如生成时间、硬件要求)尚未有详细数据。
  • 关于模型在 ComfyUI 上的具体节点使用方法和限制尚未有官方文档。

为什么重要

  • 打破硬件壁垒:MiniMax 视频模型原本体量庞大,此次 ComfyUI 的原生支持与深度优化,让普通开发者无需昂贵的专业级显卡即可在本地体验、调试多模态视频生成,极大地推动了开源视频模型在个人创作者群体中的普及。
  • 多平台生态扩展:除了 ComfyUI,MiniMax H3 还登陆了 SGLang Diffusion 和 lmsysorg,为开发者提供了更多部署选择,进一步降低了使用门槛。

第 11 集 · MiniMax 发布开源全模态模型 H3,支持原生 2K 音视频生成(2026-08-02,14 条)

MiniMax 正式发布并开源了通用全模态生成系统 MiniMax-H3。该模型参数量为 33B,能够统一理解文本、图像、视频和音频的多模态上下文,并支持文生视频、图生视频、参考图生成视频等多种输入方式,甚至允许用户在一次生成中同时启用视频、图像、文本与音频作为参考素材。在输出方面,H3 能够端到端生成最高 2K 分辨率、最长 15 秒且带有原生立体声的视频,而非后期配音。

已确认

  • 模型规格与开源:MiniMax-H3 参数量为 33B,模型权重已在 Hugging Face 公开,并适配了 🧨 Diffusers。此外,vLLM 项目也联合 MiniMax 推出了相应的部署方案,ComfyUI 也宣布了 Day 0 原生支持。
  • 生成能力:支持生成最高 2K 分辨率、最长 15 秒的视频,并原生支持 text/image-to-audio(文本/图片生音频),实现音视频同步生成。得益于面向任务泛化等技术,该模型具有极低的推理成本。
  • 榜单成绩:据 @NerdyRodent 转述,H3 在 Artificial Analysis 视频编辑榜单排名第一,文生视频榜单排名第二。

为什么重要

  • 视听一体化:H3 实现了端到端的视听内容连贯生成,无需后期配音,大幅降低了视频创作的门槛与流程复杂度。
  • 开源生态:作为目前少有的强大开源视频模型,H3 开放权重并积极适配主流推理与节点工具,为社区开发者提供了极具竞争力的多模态基础方案。

第 12 集 · 实测对比AI视频模型生成成本(2026-08-02,2 条)

创作者使用相同提示词实测多款AI视频模型并对比生成成本。MiniMax H3能以每分钟7.80美元的成本生成带音频的2K视频,远低于Seedance 2.0的22.4美元,价格优势显著。具体单次生成费用显示,Seedance 2.5为5.48美元,Seedance 2为2.99美元。这场价格战正在重塑视频创作的工作流。

第 13 集 · MiniMax H3与FLUX3攻克音频幻觉(2026-08-02,2 条)

近期测试表明,最新一代开源权重视频模型 MiniMax H3 与 FLUX3 成功解决了困扰该领域已久的“音频幻觉”痛点。此前,音画不同步等问题严重制约了实际应用,而这一突破标志着视频生成技术正迈向更高级的世界模拟阶段,为创作者打开了全新应用大门。