反直觉实测:MiniMax H3全量大模型比量化版更快且物理一致性更好

Wise_Revolution385 · reddit · 2026-08-08

一位开发者在配备 121GB 统一内存的 ASUS GX10 上,对 MiniMax H3 视频生成模型进行了反直觉的对比测试:66.3GB 的全量 BF16 模型不仅比 20.9GB 的剪枝 INT8 模型推理速度更快,生成的视频质量也显著提升。

性能方面,全量 BF16 模型的 DiT 推理速度比 INT8 版快约 12-23%。作者推测这是因为 INT8 模型额外的反量化计算抵消了显存占用优势,而 GX10 的统一内存带宽足以支撑大模型高效运行。

视频质量方面,全量大模型在以下维度表现出明显优势:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →