8-bit KV cache 严重拖累本地推理性能
Sentdex · x · 2026-07-03
Sentdex 发现一个反直觉现象:很多人以为 8-bit KV cache 对本地上下文是"免费"的,但实测 GLM 5.2(4-bit 权重搭配 8-bit KV)时性能大幅下滑——Terminal Bench 得分从 46/89 掉到 21/89。结论是与其用 8-bit KV,不如直接用 2-bit 的 GLM 5.2。
「Infra」频道最新
- Nvidia 与 OpenAI 2500 亿美元担保新闻的重复转述 — rohanpaul_ai · 2026-07-27
- Nvidia 讨论为 OpenAI 10GW 俄亥俄园区提供 2500 亿美元担保 — rohanpaul_ai · 2026-07-27
- NVIDIA 等多家公司联署公开信,力挺开放前沿模型 — ying11231 · 2026-07-27
- AI 记忆芯片热潮下,CXMT 上市首日涨近 500% — Polymarket · 2026-07-27
- 游戏本跑图太慢?本地与云端图像生成算力成本探讨 — Simple-Evidence-9125 · 2026-07-27
- 有人估算闭源模型每兆字节权重要烧 1 万美元算力 — JosephJacks_ · 2026-07-27