用 4B 小模型替换 32B:MiniMax H3 视频生成的极限压缩实测
Fit_Ad7343 · reddit · 2026-08-09
作者分享了一种将 MiniMax H3 视频生成模型中原有的 Qwen3-VL-32B 文本编码器替换为 Qwen3-VL-4B 的技术方案。通过学习一个线性投影矩阵(岭回归),将 4B 模型的隐藏状态映射到 32B 的条件空间,成功将显存占用从 15.7GB 降至 4.5GB。
技术细节与效果:
- 由于两个模型共享相同的分词器,可以通过简单的岭回归进行位置对齐,无需复杂的梯度训练。
- 尽管测试余弦相似度仅为 0.71,但 DiT 模型对该误差容忍度极高,实际生成视频质量未受明显影响。
- 包含严格的对照组测试(零矩阵和单位矩阵),证明了学习到的矩阵确实提供了关键的结构化信息。
局限性:
- 丢失了 32B 模型中的部分世界知识,某些特定人物、地标或品牌可能无法正确渲染。
- 线性投影已达性能上限,进一步提升需要引入 MLP 结构。
「多模态」频道最新
- ComfyUI 插件更新:全面支持 Minimax H3 模型 — Obvious_Set5239 · 2026-08-09
- 疑似新 GPT 图像模型曝光,代号 mona-lisa-1 — mark_k · 2026-08-09
- 实战分享:用多模态工具组合打造高一致性 AI 角色 — Gocciole · 2026-08-09
- MiniMax H3 实测:一键完成视频角色替换 — beatlepol · 2026-08-09
- 用Minimax H3自制《宋飞正传》风格短片,本地生成 — Altruistic_Dealer_59 · 2026-08-09
- 开发者实测语音生成游戏概念图,惊叹 Imagen 表现惊艳 — Dimillian · 2026-08-09