实测:写入时 Q8 KV 量化拖累长上下文,事后整体量化无损

maddie-lovelace · reddit · 2026-08-28

Reddit 用户在 Qwen3.8-27B 上的实验发现,Q8 KV cache 量化并非"免费":llama.cpp 等后端在写入时量化 KV,每一步 prefill 都会读取已被量化的 key,亚 1% 的舍入误差在每层不断复合,导致 bf16 下能通过的 needle retrieval 在 125k 上下文时失败。

关键结论是问题出在量化时机而非量化本身:把 bf16 下构建好的 cache 整体一次性量化到 Q8,误差确实只有约 1%,needle retrieval 恢复正常。作者提醒样本仅限单一模型家族、试验次数少、部分实验跑在自制 MLX 栈上,但机制可能具有普遍性——长上下文质量下降时,应怀疑是逐 token 在线量化而非量化能力本身。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →