剪枝 Q8 专家可获 Q4 模型大小与精度

EyalToledano · x · 2026-08-27

作者探讨在 Kimi K2 模型上的剪枝实验方案。初步想法是通过剪枝 Q8 量化版的部分专家,使其模型大小降至当前 Q4 版本(97GB)的量级,从而在相同体积下获得接近 Q8 的精度表现。

所属事件:剪枝 Q8 模型实验:Q4 体积换近 Q8 精度(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →