实测:写入时 Q8 KV 量化拖累长上下文,事后整体量化无损
maddie-lovelace · reddit · 2026-08-28
Reddit 用户在 Qwen3.8-27B 上的实验发现,Q8 KV cache 量化并非"免费":llama.cpp 等后端在写入时量化 KV,每一步 prefill 都会读取已被量化的 key,亚 1% 的舍入误差在每层不断复合,导致 bf16 下能通过的 needle retrieval 在 125k 上下文时失败。
关键结论是问题出在量化时机而非量化本身:把 bf16 下构建好的 cache 整体一次性量化到 Q8,误差确实只有约 1%,needle retrieval 恢复正常。作者提醒样本仅限单一模型家族、试验次数少、部分实验跑在自制 MLX 栈上,但机制可能具有普遍性——长上下文质量下降时,应怀疑是逐 token 在线量化而非量化能力本身。
「Infra」频道最新
- 美商务部拟禁中企远程访问海外英伟达芯片 — McDonaghMatthew · 2026-08-28
- 美数据中心 2026 年或面临 17-29GW 电力负荷缺口 — BenBajarin · 2026-08-28
- 算力支出正追赶而非引领用户增长曲线 — YvesMulkers · 2026-08-28
- a16z 谈为何基础设施成为 AI 新瓶颈 — a16z · 2026-08-28
- AI 芯片商燧原科技估值翻倍,获 20 亿元融资 — pstAsiatech · 2026-08-28
- a16z 募资 11 亿美元成立机器时代基金,投算力与机器人 — a16z · 2026-08-28