实测用4B/8B模型替换MiniMax H3的32B文本编码器

Fit_Ad7343 · reddit · 2026-08-10

MiniMax H3 视频生成模型原本依赖一个高达 32B 参数的文本编码器(占用 15.7 GB 显存)来处理提示词。开发者尝试使用 Qwen3-VL 4B 或 8B 模型,结合一个学习到的映射网络来替换它,以降低资源消耗。

在最新的概念验证更新中,开发者通过引入小型残差网络和补充 TMDB 名人数据集,成功解决了前期的音量过低、指令遵循能力达瓶颈以及特定人物生成不准确等问题。目前 4B 和 8B 替换版的指令遵循能力已大幅提升,且相关代码和矩阵权重已开源。

所属事件:实测用4B或8B小模型替换MiniMax H3的32B编码器(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →