MiniMax-H3 量化发布:为何保留 FC2 层为 BF16
marres · reddit · 2026-08-22
作者发布了 MiniMax-H3 Pruned Ref-Delta Fused r1024 模型的 INT8 和 INT8 ConvRot 量化版本,专为 ComfyUI 设计。
量化策略:在 50 个 Transformer 块中,将 attn.qkv、attn.out 和 mlp.fc1 (共 150 层) 量化为 INT8,但刻意将 mlp.fc2 层保持为 BF16 精度。
技术原因:全 INT8 量化版本在执行大序列任务时,ComfyUI 的融合 linearinputact(..., "swiglu") 路径会尝试对完整激活矩阵进行动态量化,导致约 491 MiB 的连续 INT8 临时分配失败(此时显存仍有 47 GiB 空闲)。保留 FC2 为 BF16 避开了这一执行路径,使完整工作流得以运行。
版本差异:普通 INT8 版本使用原生逐张量量化;INT8 ConvRot 版本在量化前对权重进行旋转(group size 256),以更好地分布异常值。模型体积约为 24.2 GB。
所属事件:MiniMax-H3 剪枝模型 INT8 量化版发布(2 条相关)→
「Infra」频道最新
- 评 CPO 论文与吐槽技术演示中的 AI 幻觉图 — jwt0625 · 2026-08-22
- GraphJin:主打零不安全影响的数据库 Agent 框架 — dosco · 2026-08-22
- 观点:恐慌感或将推动解决数据中心基建难题 — wordgrammer · 2026-08-22
- CPU 还是内存?一文讲透算力瓶颈本质 — ericjang11 · 2026-08-22
- Mac 组分布式推理网络 Darkbloom:年收 10 万美元 — gajesh · 2026-08-22
- 用 GPT-5.6 优化光通信信道串扰,需交错信道 — jwt0625 · 2026-08-22