MiniMax-H3 量化发布:为何保留 FC2 层为 BF16

marres · reddit · 2026-08-22

作者发布了 MiniMax-H3 Pruned Ref-Delta Fused r1024 模型的 INT8 和 INT8 ConvRot 量化版本,专为 ComfyUI 设计。

量化策略:在 50 个 Transformer 块中,将 attn.qkv、attn.out 和 mlp.fc1 (共 150 层) 量化为 INT8,但刻意将 mlp.fc2 层保持为 BF16 精度。

技术原因:全 INT8 量化版本在执行大序列任务时,ComfyUI 的融合 linearinputact(..., "swiglu") 路径会尝试对完整激活矩阵进行动态量化,导致约 491 MiB 的连续 INT8 临时分配失败(此时显存仍有 47 GiB 空闲)。保留 FC2 为 BF16 避开了这一执行路径,使完整工作流得以运行。

版本差异:普通 INT8 版本使用原生逐张量量化;INT8 ConvRot 版本在量化前对权重进行旋转(group size 256),以更好地分布异常值。模型体积约为 24.2 GB。

所属事件:MiniMax-H3 剪枝模型 INT8 量化版发布(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →