FP4 KV cache 几乎不占显存?推理工程师热议激进压缩方案
stochasticchasm · x · 2026-09-11
有工程师讨论一种激进的推理优化:FP4 KV cache 无明显质量退化,配合通过 CSA 压缩 KV,使模型几乎不占 KV cache 空间。
作者跟帖补充:单次请求仍需在 HBM/内存中用 KV cache 完成推理,但请求之间若 KV 占用巨大,不如直接重新 prefill——在 50 万上下文级别这点算力开销可忽略不计。他推测推理工程师会围绕 kernel 归约顺序等细节展开不少优化工作。
所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→
「Infra」频道最新
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11
- NVIDIA 单季数据中心营收 890 亿美元,算力不能再当 IT 开支看 — PeterDiamandis · 2026-09-11
- 实验室 Xeon 跑 DeepSeek V4.1,CPU 纯 CPU 推理项目开源 — Qwen30bEnjoyer · 2026-09-11