专题 · FULL STORY

MiniMax H3开源视频模型发布与实测

MiniMax H3模型开源即登顶榜单,引发海内外密集实测。社区探索了其高画质音视频同步、角色一致性及工作流应用,证实了其卓越潜力与部分局限。

2026-08-04 ~ 2026-08-15 · 10 集 · 110 条

第 1 集 · MiniMax-H3登顶开源视频模型,总榜第三(2026-08-04,5 条)

MiniMax 最新发布的视频生成模型 H3 在多项基准测试中取得突破,成为当前最先进的开源视频生成模型,并在总榜上名列前茅,大幅缩小了与闭源模型的差距。

已确认

  • 榜单成绩:在最新的 Text-to-Video Arena 榜单中,MiniMax-H3 获得 1455 分,总榜并列 第 3 名,仅次于 Muse Video 和 Hailuo-2.3。
  • 开源 SOTA:该模型在文生视频和图生视频两个维度均位列开放模型(开放权重)第一名。据 @aziz4ai 转述,H3 在 LMSYS Chatbot Arena 和 Artificial Analysis 的基准测试中均已成为开源 SOTA。
  • 图生视频能力:据 @PetersOdyssey 指出,H3 的图生视频能力已近乎追平 Dreamina Seedance 2.0。

为什么重要

  • 开源与闭源差距缩小:MiniMax-H3 的发布标志着开源视频生成模型在性能上进一步逼近甚至比肩闭源模型,为开发者提供了更强大的免费/开放替代方案。
  • 竞争格局变化:H3 在榜单上的表现打破了现有的排名格局,直接对 Muse Video、Hailuo 以及 Seedance 等头部模型构成了实质性竞争压力。

第 2 集 · MiniMax H3视频模型实测:画质惊艳,支持本地部署(2026-08-04,16 条)

MiniMax 旗下海螺 AI 正式上线 H3 视频生成模型,主打顶级画质与多参考图控制能力。发布后数日内,大量创作者进行了密集实测,普遍认为其开箱效果惊艳,在复杂场景连贯性、人物动作物理表现以及多分辨率适配方面展现出极高潜力,且已确认支持通过 ComfyUI 在本地设备运行。

已确认

  • 核心能力:多位用户(@Athem、@Wide-Researcher583 等)确认模型在复杂场景和元素连贯性上表现极其出色。@HanjoneChan 测试了功夫打斗等复杂动作,验证了其出色的动态流畅度与物理表现,认为有望融入短剧等影视制作工作流。@NOS4A2-753 也展示了模型在人物神态与压迫感细节上的生成能力。
  • 多模态与工作流控制:@aziz4ai 通过包含多张参考图和严格提示词的表格工作流,直接生成了无需后期剪辑的高质量阿拉伯语动态图形;随后他又证实,仅输入单张随机图片并套用旧版 JSON 提示词,也能生成令人惊艳的动态效果。@Brujah 展示了使用默认 ComfyUI 工作流生成电影预告片的完整叙事案例,@Gloomy-Radish8959 也耗时两天结合过往参考素材制作了故事短片。
  • 本地部署支持:网友 AlmostYeti 与 Hugging Face 的 Victor Mustar 确认,MiniMax H3 可以 100% 在本地设备上运行,并成功生成极具动感的 POV 镜头,画质依然保持极高水准。
  • 多场景与多分辨率适配:@katattack1983 成功复刻了由 David Attenborough 旁白解说的电鳗纪录片风格视频,@mockinfox 验证了模型在不同长宽比和分辨率下的良好表现,@CurieuxExplorer 展示了电影级微缩模型特效场景的还原能力。

为什么重要

MiniMax H3 在初期实测中展现出的多参考图控制和对复杂动作的精准生成,直接切中了当前 AI 视频生成在镜头语言和叙事连贯性上的痛点。更重要的是,其对 ComfyUI 和本地部署的友好支持,为专业创作者将 AI 深度融入现有影视工业流提供了极具实用价值的工具,大幅提升了创作效率。

第 3 集 · MiniMax H3实测:音画同步惊艳,提示词需写明台词(2026-08-05,19 条)

近期多位创作者集中实测了MiniMax(社区多称H3)视频生成模型。该模型展现出惊人的提示词遵循度,不仅能单次生成多段连贯视频,其原生音视频同步生成能力更是打破了以往创作壁垒,在生成速度、画质与成本上均获得了社区的高度评价。

已确认

  • 多段连贯生成与提示词遵循:@intermundia 实测在单次提示词下,模型成功生成了8段时长15秒的视频片段。@jefharris 与 @Devajyoti1231 也验证了其惊人的提示词遵循能力,后者甚至通过包含多时间戳与镜头语言的长提示词,完美还原了带有IMAX质感的日本特摄大片。
  • 原生音视频同步生成:@Smyshnikof 指出,H3能在一次生成中同步产出视频与音频(环境音、人声等),体验类似Sora 2。@GrayingGamer 成功还原了皮卡德船长的经典声音;@NickMcGurkThe3rd 与 @wikid24 分别对其惊艳的原生声音表现及多类型英语口音生成能力给予盛赞。
  • 动画风格与细节控制:@DeerWoodStudios 仅通过纯文本在5秒内生成了《瑞克和莫蒂》风格视频,验证了模型在处理动画角色连贯性、对白生成及面部表情控制方面的能力。
  • 照片转视频与成本优势:@TradehelperAI 仅使用一张人脸照片、一张全身照及15秒音频样本,就成功生成了爆款梗图视频。@dorocreator 指出,在RTX 3090上渲染15秒1056x608分辨率视频耗时约26分钟,成本约8美分,相比Seedance2成本大幅降低85%。
  • 硬件需求与生成效率:实测显示该模型对硬件配置要求与生成时间差异较大。@R34vspec 使用单张RTX 5090和96GB内存,以0.7兆像素分辨率和20步设置,耗时2分钟生成带音效视频;@AxonkaiLab 在BF16精度与原生音频支持下,生成15秒视频耗时约23分钟;@gorkem 转发称在Fal平台上生成耗时不到15秒;@cocktailpeanut 转发测试称在RTX 4080 16GB显存环境下生成1280x720视频约需30分钟。
  • 音频生成的局限性:@cocktailpeanut 与 @Alexthetiktock 实测发现,如果在提示词中不明确指定角色的具体台词,生成的语音往往会退化成毫无意义的乱码,因此建议务必详细写出对白以确保输出质量。

为什么重要

在当前AI视频生成领域,模型对复杂提示词的理解程度、生成内容的时空连贯性以及音画同步一直是核心痛点。MiniMax H3在实测中展现出的单次多段生成、精准的指令响应以及媲美Sora 2的原生音频同步能力,表明其在可用性和实际创作效率上取得了实质性突破,为高质量影视及复杂视频创作提供了强大的新工具。

第 4 集 · MiniMax发布H3视频生成模型(2026-08-05,3 条)

MiniMax即将推出H3视频生成模型并已开启早期访问。新版本主打2K高分辨率输出与5倍生成加速,并引入了摄像机预览功能。该模型集成了多素材参考、声音克隆和精准场景编辑等能力,旨在无缝对接实际生产工作流,大幅缩短AI视频与真实专业制作之间的差距。

第 5 集 · MiniMax H3实测:多风格惊艳,动作物理仍受限(2026-08-06,13 条)

近期 Reddit 用户对 MiniMax H3 视频生成模型进行了多维度实测。整体来看,该模型在多种艺术风格和特定 IP 角色的还原上展现出卓越能力,但在处理复杂物理动作时仍存在局限。这些测试表明 MiniMax H3 是一款表现亮眼且极具娱乐性的视频生成工具。

已确认

  • 视觉表现力与开源评价:多位用户实测确认 H3 在多种视觉风格上表现优异。@Tall-Benefit9471 验证了其中世纪写实风格的表现;@huggalump 成功利用该模型生成了极具解谜游戏《奥伯拉·丁的回归》特色的 1-bit 复古黑白风视频;@HotStore5699 展示了其生成《银翼杀手》风格赛博朋克视频的能力,电影质感惊艳。@cloneofsimo 通过 API 测试,高度认可其在动漫风格图像生成上的出色表现,并赞扬了 MiniMax 在开源领域的持续投入。@Disastrous-Agency675 戏称该模型为不受限制的开源“Sora”,认为其达到了早期 Sora 的预期水平。@poopoofingers 和 @StiffNippys 均表示该模型的动态画面生成效果极其逼真震撼,且极具娱乐性。此外,@seppe0815 分享了《猫狗历险记》主题的优秀生成效果。
  • 角色识别与一致性:@CautiousChicken604 在低画质(0.3-0.4MP)和 15 步数的设置下,成功生成了《恶搞之家》与《哆啦A梦》结合的画面,指出此前试过的多种模型均无法准确识别哆啦A梦,但 H3 做到了。@Devajyoti1231 的测试表明该模型的角色参考图(Character Reference)功能具备良好的连贯性。@EYECANDYVFX 也高度评价了该模型,称其利用 ref2VA 功能结合详细提示词一次性生成 5 秒视频片段的表现令人难以置信,且拼接后保持了良好的连贯性。
  • 动作处理局限:@TrueProtection6842 分享了一个翻车案例,显示模型在生成画面时出现了人物动作幅度和走向完全失控的现象,被调侃动作过于离谱。@Any-Scar765 也分享了模型生成超现实荒诞情节的离谱表现,画面中路人的经历极其怪异。

为什么重要

MiniMax H3 的实测表现证明了其在多风格渲染和特定 IP 角色还原上的强大潜力,这为创意工作者提供了极具娱乐性和表现力的新工具。同时,动作失控的案例也客观标定了当前视频生成模型在物理规律理解上的技术边界。

第 6 集 · MiniMax H3实测:角色一致与续写工作流获赞(2026-08-07,13 条)

近期多位创作者实测了 MiniMax H3 视频生成模型,围绕角色一致性、视频续写和文本转视频等场景探索出多种高效工作流。该模型在保持连贯动作和高质量画面方面的表现获得了积极评价,多位创作者称其效果“如同魔法一般”,被认为是目前制作短片的有效工具。

已确认

  • 角色一致性与连贯动作:@BigDovahkiin 分享了使用 Krea 生成角色设定图,再利用 MiniMax 参考图模式保持角色一致性的工作流,成功生成了赛博朋克风格的连贯打斗短片。他表示这是第一个让他没有感到无聊的视频模型。
  • 视频续写工作流:@Exile3D 探讨了使用 H3 模型延长或续写视频片段的有效方法。他认为最佳流程是结合多个角色参考图和配音,将视频的最后一帧作为参考加载,以此为基础让模型继续生成并保持角色一致性。
  • 文本转视频能力:@andrewh2000 实测将小说《Dungeon Crawler Carl》的文本内容直接输入模型,成功转化为了高质量的电影级视频片段。
  • 参考图使用技巧:@GlitteringTie3110 测试了利用参考图提升角色一致性并尝试跨作品角色融合。实验发现,保持参考图的宽高比与目标视频一致,并严格遵循官方提示词编写指南,能显著提升生成质量。
  • 自动化工作流:@jacobpederson 展示了使用 Krea 和 Minimax H3 模型构建的自动化视频生成工作流(Reimagine Script v3.0)。
  • 音视频对话拼接:@niechta 将 AI 视作“笨拙的摄影师”,通过分别生成独立镜头、覆盖画面和无声反应片段,手动剪辑拼接出一段 2 分钟的对话场景。
  • T2V 结合首帧生成:@reynadsaltynuts 采用先生成文本到视频(T2V),再结合首帧生成视频(1st Frame2V)的工作流制作动画。
  • 视频角色替换:@beatlepol 实测了视频角色替换功能,成功将原视频中的巨型猫咪替换为狗狗,并保持了原有的场景设定和动画轨迹。
  • 复杂场景与图生视频:@uhf789 分享了图生视频(Image-to-Video)的实测演示;@Disastrous-Agency675 生成了名为“Between heaven and hell”(天堂与地狱之间)的视频,展示了复杂场景与氛围渲染能力;@egeberkina 转发了由 H3 生成的片段,调侃其呈现出如同被删减的情景喜剧般的意外效果。

为什么重要

这些实测案例展示了 MiniMax H3 在实际创作中的潜力。通过结合外部工具(如 Krea)和特定的提示词技巧,创作者已经能够解决视频生成中长期存在的角色一致性和动作连贯性痛点,使其具备了制作高质量叙事短片和跨媒介内容改编的实用价值。

第 7 集 · MiniMax H3海外实测:多风格长视频生成获好评(2026-08-12,13 条)

8月12日至14日,MiniMax H3视频生成模型在海外社区引发集中实测,十余名用户晒出图生视频、动漫复刻、写实手持、海报动画等多样demo。普遍反馈是输出质量高、生成过程成瘾性强;Motion Context双片段链接与参考图引导被视为解决多镜头连贯、角色一致性问题的有效手段。有用户还晒出RTX Pro 6000 Blackwell本地硬件配置,显示该模型可在本地运行。

已确认

  • @GamerVick 使用双片段链接(two chained clips)加 Motion Context 功能生成 30 秒连贯短故事,验证多镜头叙事能力(m1 与 m9 为同一演示,仅计一次)。
  • @OohFekm 仅用一张图片加一句提示词(蝙蝠侠跑向海边观察怪物并用热视线射击),配合应用内 LLM 增强提示词完成图生视频,效果极佳。
  • @JahJedi 基于 ref2av 工作流,以两张角色参考图和一张学校场景照片引导生成,参数为 1.5 百万像素、30 步,并启用了 sage…(帖文截断)。
  • @nothashira 复刻《龙珠》2D 动漫风格并创作同人角色,展示了特定动漫风渲染与动作连贯性。
  • @b-totherent 将 H3 与 LTX 2.5 结合,生成自然光影、拟真动作的手持写实画面。
  • @JustARedditUser33 生成《浴血黑帮》主题混剪,呈现复古电影质感,同时体现模型对现代敏感度审查的处理表现。
  • @princeMacX 生成蝙蝠侠与小丑屋顶打斗、俱乐部打扑克两个场景,测试复杂动作与叙事。
  • @LudovicCreator 将静态海报动画化并尝试 16:9 比例,认为这为动画创作打开更多可能。
  • @dhavalhirdhav 生成 30 秒巨龙视频,展示长视频生成与复杂生物动态控制的潜力。
  • @moohlit 称生成极具成瘾性、几乎每次输出都令人惊艳,并附 RTX Pro 6000 Blackwell 本地配置(模型标注 L2VA);@esudious 表示玩得很开心。

尚未确认

  • 本地运行的具体部署细节(如显存占用、推理速度)未在帖中提供,本地可用性仍待更多信源确认。

为什么重要

  • Motion Context 与参考图引导(ref2av)直指 AI 视频的两大痛点——多镜头连贯与角色/场景一致性,社区实测初步验证有效。
  • 风格覆盖面广:2D 动漫、复古电影、写实手持、海报动画均有正面反馈,且出现多个 30 秒长片段案例。
  • 有用户在本地高端显卡上运行并给出配置信息,但帖文未提供完整部署细节,本地可用性仍待更多信源确认。

第 8 集 · MiniMax H3 视频生成模型实测与创意展示(2026-08-13,24 条)

MiniMax H3 视频生成模型在 Reddit 和 X 上引发密集实测,用户展示了其在音乐视频、场景模拟及编辑方面的潜力,尤其在唇形同步和参考视频编辑上表现出色,但本地部署的算力瓶颈导致生成速度缓慢。

已确认

  • 多样生成效果:beatlepo、pooshda、JustSecond9861 等用户展示了 H3 生成的城堡场景、恶搞广告、漫画风格动画及进化模拟视频。
  • 唇形同步能力突出:Kyrannio、michel-yph-ai、stonyleinchen 实测音乐视频对口型精准,stonyleinchen 介绍了逐 token 噪声掩码技术,michel-yph-ai 指出复杂动作下物体不变形。
  • 视频编辑工作流有效:socialwithaayan 和 illumination25 展示了使用参考视频/图片加提示词进行复杂编辑,illumination25 仅用 2 张照片成功替换 12 秒武打视频背景。
  • 本地部署速度差异大:danielcar 在 AMD Strix Halo 上生成 5 秒视频需 9.5 分钟;EvolvingSoftware 在 RTX 3090 上生成 10 秒视频约 15.5 分钟;vanonym 在 RTX Pro 6000 上生成 42 秒视频耗时 80 分钟;另有测试显示 12GB 显存生成 10 秒 480p 需 10 分钟。
  • 加速方案:michel-yph-ai 使用 8 步 Turbo LoRA、Spectrum 和 Triton 在 L40 上加速;danielcar 使用 int8 剪枝和 4 步 turbo LoRA。

尚未确认

  • 模型的具体版本号、参数细节及官方具体发布信息未在帖子中详细提及。

为什么重要

MiniMax H3 展示了 AI 视频生成在创意表达和实用编辑上的显著进步,特别是唇形同步和参考视频编辑能力,有望推动音乐视频和影视后期应用的发展。同时,实测数据揭示了当前消费级硬件在运行高端视频生成模型时的性能瓶颈。

还有 4 条相关讨论 →

第 9 集 · MiniMax H3登顶AI视频编辑竞技场榜单(2026-08-13,2 条)

知名大模型竞技场发布了最新的 AI 视频编辑排行榜。本期榜单基于超 2.5 万次社区投票,对 8 款主流模型进行了盲测评估。结果显示,MiniMax 发布的 H3 视频编辑模型成功拿下第一名。官方称该模型不仅在开源领域处于领先地位,更达成了整体 SOTA(当前最佳)水平,字节 Seedance 紧随其后。

第 10 集 · MiniMax H3 提示词模板直出高质量视频(2026-08-15,2 条)

作者认为 AI 视频生成的成本在于提示词质量而非模型本身,为此为 MiniMax H3 构建了 JSON 提示词模板,填入想法即可生成视频。文中展示 5 种场景案例,文本指令直接产出高质量成片、无需后期编辑,并提供可复用的提示词结构。