本地 LLM 推理的可用基线是 8-bit KV cache 加 4-bit 权重
max_paperclips · x · 2026-07-24
这篇文章总结了本地 LLM 推理的“最低可用”量化基线:8-bit KV cache + 4-bit 权重,在多数场景下可保留 94–99% 的 BF16 质量。
- 低于 4-bit 权重 后,质量会明显下滑。
- 低于 8-bit KV cache 的方案大多仍停留在研究级。
- REAP 主要适用于 MoE,且经常带来质量退化。
- INT4 在推理、数学、代码任务上都有可测的损失。
- 质量大致呈现为:FP8 > INT8 > Q5KM > Q4KM > Q2K。
「Infra」频道最新
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11