FP4 KV cache 直出无退化,推理工程师有得玩了

stochasticchasm · x · 2026-09-11

作者评论某新模型架构的两个关键设计:一是 KV cache 直接以 FP4 精度存储且观察不到退化,二是通过 CSA(及其 v4 中 CSA/HCA 双频率交替的压缩方案,新设计改为纯 CSA2)压缩 KV。两者叠加使模型几乎不占 KV cache 空间。作者认为这对推理工程是大利好,同时好奇 kernel 缩减顺序等实现细节会对性能产生什么影响。

所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →