剪枝 Q8 专家可获 Q4 模型大小与精度
EyalToledano · x · 2026-08-27
作者探讨在 Kimi K2 模型上的剪枝实验方案。初步想法是通过剪枝 Q8 量化版的部分专家,使其模型大小降至当前 Q4 版本(97GB)的量级,从而在相同体积下获得接近 Q8 的精度表现。
所属事件:剪枝 Q8 模型实验:Q4 体积换近 Q8 精度(2 条相关)→
「Infra」频道最新
- TokenVisor 支持在单集群中混合使用 Nvidia/AMD/Intel GPU — AccBalanced · 2026-08-27
- Zai 国内推理集群破 10 万,智谱自研高速互联 — zephyr_z9 · 2026-08-27
- PeriodicLabs 用 Kimi 降低推理成本 50 倍 — LiamFedus · 2026-08-27
- Unsloth 版 llama.cpp 暂不支持 MTP — keepthememes · 2026-08-27
- Qwen3 MoE 剪枝实测:180B 级模型压到 65GB 可跑笔记本 — EyalToledano · 2026-08-27
- MCP servers 应更像 API,少预设工作流 — HankYeomans · 2026-08-27