MiniMax 发布 H3 全模态模型:支持图生视频与原生音频
RisingSayak · x · 2026-08-06
MiniMax 发布了全新的 H3 模型,被业界视为开源界的一大胜利。该模型是一个 33B 参数的 DiT 架构通用全模态生成系统。
主要特性包括:
- 多模态输入:支持文本、图像、视频和音频的统一理解。
- 音视频生成:能够生成带有原生立体声的视频,最长可达 15 秒,最高支持 2K 分辨率与 24 FPS。
- 开源支持:基础管线已完全集成至 Hugging Face Diffusers 库,并配备了多种显存与速度优化。
- 多语言对话:稳定支持中、英、日、韩等 11 种语言。
所属事件:MiniMax 发布 33B 全模态开源模型 H3(2 条相关)→
「模型」频道最新
- 曝 OpenAI 下周发布新模型 Astra,已解决十余项数学难题 — rohanpaul_ai · 2026-08-06
- DeepSeek融资文件泄露:V4-Pro性能比肩Claude,适配昇腾 — xiaohu · 2026-08-06
- GPT 系列模型为何偏爱逗号分隔列表? — mariofilhoml · 2026-08-06
- Kimi K3 对比 Grok 4.5:谁能更好补全草图? — CodeByPoonam · 2026-08-06
- Unsloth的Gemma 4 mmproj与新版llama.cpp不兼容,多模态功能静默失效 — Top_Speaker_7785 · 2026-08-06
- t0-alpha 时间序列预测基础模型发布,采用 Apache 2.0 开源 — fpedregosa · 2026-08-06