MiniMax 发布全模态模型 H3,支持原生双声道 2K 音视频生成
智东西 · wechat · 2026-07-31
MiniMax 发布全模态生成模型 MiniMaxH3,能统一理解文本、图像、视频和声音,并原生生成带双声道的音视频,最高支持 15 秒 2K 分辨率输出。
该模型打破了以往文生图、图生视频、音色参考等隔离的任务管线,在预训练阶段即混合多模态数据进行统一建模,用户可通过自然语言自由组合不同素材进行创作。官方称其在 ArtificalAnalysis 文生视频有声榜单中排名第二。
价格方面,MiniMax 宣称 H3 在 2K 分辨率下每秒成本不到主流模型的 1/3,并计划在未来几天内合规开放模型权重。
所属事件:MiniMax发布全模态模型H3,支持2K原生立体声视频(16 条相关)→
「模型」频道最新
- DeepSeek-V4-Flash 仓库惊现 Hugging Face,支持百万 Token — NielsRogge · 2026-07-31
- 实测 DeepSeek-V4-Flash 智能体:3D 任务成本仅 0.07 美元 — cedric_chee · 2026-07-31
- DeepSeek-V4-Flash-0731 模型权重正式开源发布 — shing3232 · 2026-07-31
- Kimi K3 与 GLM 5.2 潜力前瞻:强化学习或带来性能飞跃 — airesearch12 · 2026-07-31
- 国产大模型 Agent 实测:Kimi K3 与 DeepSeek V4 Pro 跑分曝光 — Teknium · 2026-07-31
- SAM 3.1 量化至 INT4:显存直降 40% 且画质无损 — External_Quarter · 2026-07-31