4-bit KV cache 实测:长文本下困惑度激增 43%,q8_0 才是性价比之王

Dhan295 · reddit · 2026-08-02

一位开发者全面测试了不同上下文长度下的 KV cache 量化表现,发现了一个反直觉的现象:4-bit (q40) KV cache 在约 2K tokens 后困惑度不降反升,到 8K 时恶化了 43%。

核心发现:

作者也提醒,测试基于较小的 Qwen3-0.6B 模型,这可能是最坏情况,但结论足以说明盲目进行 KV 量化的风险。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →