本地 LLM 推理的可用基线是 8-bit KV cache 加 4-bit 权重
max_paperclips · x · 2026-07-24
这篇文章总结了本地 LLM 推理的“最低可用”量化基线:8-bit KV cache + 4-bit 权重,在多数场景下可保留 94–99% 的 BF16 质量。
- 低于 4-bit 权重 后,质量会明显下滑。
- 低于 8-bit KV cache 的方案大多仍停留在研究级。
- REAP 主要适用于 MoE,且经常带来质量退化。
- INT4 在推理、数学、代码任务上都有可测的损失。
- 质量大致呈现为:FP8 > INT8 > Q5KM > Q4KM > Q2K。
「Infra」频道最新
- Synopsys CEO 称 AI 芯片设计已到 L4,前端用上 6 到 8 个智能体 — Scobleizer · 2026-07-24
- 光子芯片测试台配上了鸡舍热灯 — jwt0625 · 2026-07-24
- NVIDIA 论文探讨 SOAP、Muon 等预训练扩尺度方法 — A_K_Nain · 2026-07-24
- 推荐:机器学习系统(ML Systems)学习资源宝库 — dhruv2038 · 2026-07-24
- DeepSeek 算力集群可靠性岗位,折射出组织快速拆分 — teortaxesTex · 2026-07-24
- 开权重模型正在赢在“普通人买得起的硬件”上 — max_paperclips · 2026-07-24