FP4 KV cache 几乎不占显存?推理工程师热议激进压缩方案

stochasticchasm · x · 2026-09-11

有工程师讨论一种激进的推理优化:FP4 KV cache 无明显质量退化,配合通过 CSA 压缩 KV,使模型几乎不占 KV cache 空间。

作者跟帖补充:单次请求仍需在 HBM/内存中用 KV cache 完成推理,但请求之间若 KV 占用巨大,不如直接重新 prefill——在 50 万上下文级别这点算力开销可忽略不计。他推测推理工程师会围绕 kernel 归约顺序等细节展开不少优化工作。

所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →