专题 · FULL STORY

MiniMax H3:从开源预告到实测登顶

MiniMax预告并发布全模态模型H3,凭借原生2K双声道视频生成能力引发轰动。模型权重开源后迅速被社区部署,并在多项实测中以低成本、低门槛登顶视频编辑榜单。

2026-07-30 ~ 2026-08-02 · 12 集 · 127 条

第 1 集 · MiniMax H3 视频模型实测:原生2K画质与商业级质感惊艳(2026-07-30,59 条)

MiniMax(海螺AI)最新一代视频生成模型H3已开启早期测试,多位创作者和开发者的实测表明,该模型在多项指标上达到行业顶尖水平,其实力被认为比肩甚至超越Seedance 2.0,展现出极高的商业应用价值。

已确认

  • 核心规格:H3模型单次生成视频最长15秒,原生分辨率最高2560×1440(2K)。作为全能模型,支持最多12个跨模态参考素材输入(涵盖图像、音频、视频等,单个素材最长15秒)。
  • 多模态生成:引入全新Omni Reference工作流,打破传统视频模型仅依赖文本的限制。用户可组合产品图、参考视频和音频等多种模态进行生成,甚至仅凭5张静态图就能生成连贯短片或影视片头。
  • 生成能力:多位创作者实测证实,H3具备极佳的复杂提示词理解能力,能精准执行包含复杂空间变换的运镜指令(如一镜到底极速穿梭)。模型在物理运动自然度、动作连贯性、文字渲染清晰度以及高保真语音与口型同步方面表现扎实。此外,它能将画面的色彩、光影与构图意图融入生成逻辑,而非机械还原元素。

为什么重要

  • 重塑商业片质感:在同等提示词测试下,多位评测者指出H3生成的成片在产品交互动态感、画面过渡流畅度及整体叙事节奏上超越了Seedance 2.0,质感非常接近高水准商业广告。
  • 创作工作流革新:H3能够完美分离视频背景与人物进行替换,且支持无后期直出。这种将多模态参考、高质量直出与极低门槛结合的特性,使其成为极具实用价值的AI视频工具。

还有 39 条相关讨论 →

第 2 集 · Google Gemini 视频生成与编辑功能限时免费开放(2026-07-30,3 条)

Google 宣布即日起至 2026 年 8 月 4 日,非订阅用户也可在 Gemini 应用内免费创建最多 10 个视频。除了基础的视频生成功能,官方还同步推出了 Gemini Omni 视频编辑工具。该工具支持物体替换、添加主体以及空间互动等高级编辑操作,为用户提供了更丰富的视频创作体验。

第 3 集 · MiniMax发布全模态模型H3,支持2K原生双声道视频(2026-07-30,18 条)

MiniMax正式发布全模态生成模型H3,该模型统一了文本、图像、视频和声音的理解与生成能力,支持原生双声道音频输出,最高可生成15秒2K分辨率(24fps)的视频。H3已上线海螺AI网页端、MiniMax API以及fal、Topview等平台,并即将以开放权重形式开源。其极具竞争力的定价(低于主流模型三分之一)引发了社区关注。

已确认

  • 多模态与输出规格:H3支持多模态上下文理解,可直接输出带有原生立体声、最高15秒2K分辨率(24fps)的视频,具备商业级可用的画面质感。作者@量子位指出,该模型打破了传统视频模型仅生成素材的局限,将剪辑逻辑、字体排版、转场设计、背景音乐及视觉特效端到端集成,可直接输出2K成片。
  • 12项资产参考(12-Asset Reference):允许用户组合多达9张图片、3个视频片段和3个音频片段作为参考,从而精准锁定角色形象、运动轨迹与音频特征。
  • 商业级能力:在精确文本与品牌信息渲染、视频到视频动作迁移(V2V Motion Transfer)等方面表现出色,主要面向广告和电商等商业场景。
  • 平台与定价:模型已上线fal、Topview平台与海螺AI。据作者@赛博禅心透露,其API价格低于主流模型的三分之一;作者@angrypenguinPNG也指出其成本仅为一小部分,功能可媲美Seedance。

尚未确认

  • 开源细节与时间:官方及多位创作者确认该模型即将开源,但具体时间表尚未完全敲定。作者@cocktailpeanut提到,官方表示将在未来几天内“遵守法律法规”开放权重,部分网友因等待开源进度而吐槽催促直接放上BitTorrent。

为什么重要

H3的发布标志着视频生成模型在多模态融合上的进一步成熟。原生立体声音频与高质量2K画面的结合,配合精细的多素材参考控制功能,大幅降低了商业视频制作的门槛。同时,其具有竞争力的定价策略以及即将开源的举措,有望在当前的AI视频生成市场中快速抢占份额。

第 4 集 · MiniMax H3模型将发布并开源,视频生成与多模态能力引热议(2026-07-30,7 条)

MiniMax 官方在 Hugging Face 平台透露,新一代模型 H3 即将发布,且权重很快会开源。官方账号同时展示了基于 H3 在海螺 AI 平台上的生成效果,引发社区惊叹。早期测试显示,H3 视频模型支持原生 2560×1440 (2K) 分辨率与长达 15 秒的视频生成,且完全由模型直出无后期剪辑;同时,H3 主打原生多模态理解,允许用户自由组合最多 12 个参考素材(视频、文本、图像和音频混合搭配)。社区讨论指出,如果 H3 能在 ComfyUI 等本地环境中以 RTX 3060 级别显卡运行,将极大造福算力贫乏的开发者。此外,MiniMax 的 Hugging Face 主页还更新了 M3 模型信息,展示了其在稀疏注意力和数学证明生成方面的能力。

已确认

  • MiniMax 官方在 Hugging Face 平台透露,H3 模型即将推出且权重很快会开源。
  • 官方账号展示了基于 H3 模型在海螺 AI 平台上的实际生成效果,引发社区惊叹。
  • 同步曝光的还有 MiniMax M3 模型的相关信息,展示了其在稀疏注意力和数学证明生成方面的能力。

尚未确认

  • 视频模型规格:据早期体验反馈,H3 视频模型支持原生 2560×1440 (2K) 分辨率与长达 15 秒的视频生成,且完全由模型直出无后期剪辑。
  • 原生多模态能力:有开发者测试称,H3 主打原生多模态理解,允许用户自由组合最多 12 个参考素材(支持视频、文本、图像和音频混合搭配)。
  • 生成效果:测试者使用极简提示词便生成了极具电影感的画面,动漫风格动画生成表现惊艳。

为什么重要

  • 如果 H3 能够在 ComfyUI 等本地环境中以 RTX 3060 级别显卡运行,将极大造福算力贫乏的开发者,降低技术门槛。
  • 其强大的多模态混合输入能力,被视为在多模态领域对标行业前沿的重要一步。

第 5 集 · Gemini Omni重塑视频生成与编辑工作流(2026-07-30,3 条)

谷歌Flow工作室集成Gemini Omni模型,正通过自然语言交互重塑视频创作工作流。用户只需输入文本提示词即可完成多种复杂操作,具体应用场景涵盖图生视频、一键转换背景风格,甚至能为无声视频自动配音并匹配人物动作。这些被挖掘出的七大实用玩法,充分展示了该模型在降低视频编辑门槛和提升创作效率方面的巨大潜力。

第 6 集 · MiniMax H3登顶视频编辑榜,宣布开源权重(2026-07-31,7 条)

据 Artificial Analysis 最新评测数据,MiniMax 最新视频模型 H3 在含音频的视频编辑类别中与 Google Gemini Omni Flash 并列第一(Elo 1130 vs 1121),文生视频(含音频)位列全球第二,图生视频跻身前三。MiniMax 官方已确认计划以社区许可证发布该模型权重,使其成为目前领先的视频模型中少有的宣布开源的产品。

已确认

  • Artificial Analysis 视频编辑排行榜(含音频)中,MiniMax-H3(开源)与 Google Gemini Omni Flash 以微弱优势并列第一(Elo 1130 vs 1121)
  • 文生视频(含音频)并列全球第二,图生视频位列前三
  • 模型支持多模态输入,可生成带原生音频的 5-15 秒 24fps 片段
  • 模型支持原生 2K 分辨率与立体声生成,并提供丰富的视频编辑功能
  • 2K 视频定价为 7.8 美元
  • MiniMax 官方确认计划以社区许可证发布该模型权重

为什么重要

  • H3 是目前领先的视频模型中少有的宣布开源权重的产品,可能降低视频生成领域的使用门槛
  • 视频原生编辑能力打破了仅从零生成的限制,支持直接输入文本、图像等素材进行编辑
  • 2K 视频 7.8 美元的定价低于多数竞品,可能对商业应用产生吸引力

第 7 集 · Topview上线MiniMax H3,价格仅为Seedance三成(2026-07-31,9 条)

视频创作平台Topview宣布与MiniMax(海螺AI)达成合作,正式上线MiniMax H3视频生成模型,成为全球首批集成该模型的平台。新模型主打原生多模态输入与高分辨率输出,且定价极具破坏力,旨在为高产能创作者提供更具性价比的选择。

已确认

  • 要点 MiniMax H3支持原生2K分辨率输出,单次可生成最长15秒的视频片段。
  • 要点 该模型能够同时理解文本、图像、音频和视频,实现跨模态的创意控制与原生音视频输出。
  • 要点 在定价方面,H3的使用成本比Seedance 2.0低70%,即价格仅为后者的30%。
  • 要点 Topview为Ultra年度用户提供了专属福利,可享受60天无限次生成。

为什么重要

  • 要点 此次Topview接入MiniMax H3,为创作者提供了一个在分辨率和时长上表现不错,且成本大幅低于竞品的新选项,有望显著降低高质量视频创作的门槛与开销。

第 8 集 · MiniMax H3视频模型即将发布,ComfyUI工作流已抢先可用(2026-08-01,2 条)

开源视频模型即将迎来重大突破,MiniMax H3 模型即将发布。目前,ComfyUI 团队已对该模型进行了深度优化,使其能够在普通的消费级硬件上流畅运行。此外,已有 Reddit 网友分享了该模型在 ComfyUI 中的工作流,该工作流目前已在特定运行节点中开放使用,方便用户提前体验。

第 9 集 · MiniMax H3 视频模型早期实测:2K画质与多模态一致性惊艳(2026-08-01,12 条)

MiniMax 即将开源的新一代视频生成模型 H3 已进入早期测试阶段,多位创作者通过 Magnific 平台进行了抢先实测。综合现有反馈,该模型在复杂动态指令执行、多镜头视觉一致性及动作捕捉方面表现突出,且审查机制极为宽松,生成成本仅为同类模型的四分之一,预计将成为视频生成领域的一款强力竞品。

已确认

  • 要点 核心参数方面,H3 作为全能模型支持最长 15 秒的视频生成,原生分辨率达到 2560 × 1440(2K 级别),支持原生双声道,并能同时理解混合的图、视频和音频参考素材。
  • 要点 创作者 @Neggy5 指出,H3 的文生视频画质略显模糊,但动作捕捉非常精准,图生视频在 2K 分辨率下表现极佳,且模型几乎无内容审查限制。
  • 要点 创作者 @umeshai 测试表明,该模型能精准理解并执行高度结构化的创意指令,在动态图形设计、复杂排版运镜以及节奏把控方面表现优异。推主 @卡尔的AI沃茨 也对其特效呈现和文字稳定性表示惊艳。
  • 要点 开发者 @gerardsans 使用 H3 制作了一段游戏风格序列动画,称赞其全参考能力能在不同镜头和快速转场中保持视觉风格的高度一致性,呈现出真实游戏预告片的质感。
  • 要点 创作者 @LudovicCreator 展示了基于静态海报生成动画的 demo,认为该模型在动画创作方面提供了出色的可能性。
  • 要点 推主 @mhdfaran 测试了模型生成复杂长镜头的能力,在包含古庙、发光神器、石头巨人和快速逃生等元素的连贯场景中,人物形象、摄像机运动、光影、水面效果和音频完美契合于同一世界观,多帧一致性惊人。
  • 要点 模型已确认可通过 Magnific 平台运行测试,并有开发者将其与 Grok 的图生视频对口型效果进行了直观对比。
  • 要点 在横向对比方面,创作者 @Brojakhoeman 和 @evereveron78 分别使用相同的赛博朋克风格等复杂运镜提示词,将 H3 与 LTX 2.3 以及 WAN 模型进行了生成效果的对比测试。

为什么重要

  • 要点 MiniMax H3 展现出了对复杂创意指令和高级运镜的精准驾驭能力,特别是在多镜头一致性上的突破,直击当前 AI 视频生成的核心痛点。此外,其几乎无审查的特点、极低的生成成本以及即将开源的预期,对创作者具有极高的吸引力。

第 10 集 · MiniMax H3视频模型实现消费级显卡本地部署(2026-08-01,3 条)

MiniMax最新发布的H3视频模型展现出极高的本地部署友好度。据ComfyUI官方团队及社区开发者实测,该模型在RTX 3060显卡配合32GB内存的消费级硬件环境下,使用8-bit权重仅需约10分钟即可生成百帧1080p分辨率、25秒时长的视频。这意味着普通开发者也能在个人电脑上低成本体验和调试高质量视频生成。

第 11 集 · 实测对比AI视频模型生成成本(2026-08-02,2 条)

创作者使用相同提示词实测多款AI视频模型并对比生成成本。MiniMax H3能以每分钟7.80美元的成本生成带音频的2K视频,远低于Seedance 2.0的22.4美元,价格优势显著。具体单次生成费用显示,Seedance 2.5为5.48美元,Seedance 2为2.99美元。这场价格战正在重塑视频创作的工作流。

第 12 集 · MiniMax H3与FLUX3攻克音频幻觉(2026-08-02,2 条)

近期测试表明,最新一代开源权重视频模型 MiniMax H3 与 FLUX3 成功解决了困扰该领域已久的“音频幻觉”痛点。此前,音画不同步等问题严重制约了实际应用,而这一突破标志着视频生成技术正迈向更高级的世界模拟阶段,为创作者打开了全新应用大门。