MiniMax 发布 33B 开源多模态模型 H3,支持图声视频生成
RisingSayak · x · 2026-08-06
MiniMax 发布了最新开源模型 H3,被视为开源社区的一大胜利。该模型是一个 33B 参数的 DiT 架构,具备强大的多模态生成能力。
主要特性:
- 全模态生成:支持图像、视频和音频的统一生成。
- 多模态输入:可接收包含音频在内的多模态指令来生成视频和音频。
- 长视频能力:最长可生成 15 秒的视频。
目前,该模型的基础管线已全面接入 Hugging Face Diffusers 库,并启用了多项内存和速度优化。
所属事件:MiniMax 发布 33B 全模态开源模型 H3(2 条相关)→
「模型」频道最新
- 曝 OpenAI 下周发布新模型 Astra,已解决十余项数学难题 — rohanpaul_ai · 2026-08-06
- DeepSeek融资文件泄露:V4-Pro性能比肩Claude,适配昇腾 — xiaohu · 2026-08-06
- GPT 系列模型为何偏爱逗号分隔列表? — mariofilhoml · 2026-08-06
- Kimi K3 对比 Grok 4.5:谁能更好补全草图? — CodeByPoonam · 2026-08-06
- Unsloth的Gemma 4 mmproj与新版llama.cpp不兼容,多模态功能静默失效 — Top_Speaker_7785 · 2026-08-06
- t0-alpha 时间序列预测基础模型发布,采用 Apache 2.0 开源 — fpedregosa · 2026-08-06