推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点
9 月 11 日,技术博主 stochasticchasm 连续发帖细读某新公布的模型架构博客,得出核心判断:当前架构改动几乎已把推理效率作为唯一目标,是一次典型的「inference-informed design」——prefill 便宜、KV cache 极小、对 prefill-decode 分离(PD disagg)部署友好,大批量 prefill 下能拿到不错的利用率。
已确认
- KV cache 直接以 FP4 精度存储,博主称观察不到质量退化;再叠加 CSA 压缩(v4 中为 CSA/HCA 双频率交替,新设计改为纯 CSA2),模型几乎不占 KV cache 空间,推理工程师有得玩。
- 解码器并非在多层上对编码器 KV 做注意力,而是周期性读取编码器最终层状态。博主修正了自己最初的假设,认为这合理:末层状态信息最丰富,且接近原始 Transformer 的设计,也并非标准的交叉注意力。
- 稀疏注意力版本不再需要稠密注意力热身阶段。博主认为这是好信号:更低的 prefill FLOPs 可以支撑长上下文预训练,也使更早引入类 agent 轨迹数据成为可能;团队还已有成熟配方和 batch invariant kernel。
- 新架构引入了 engram 机制并简化了 mHC,博主认为都是意料之中的改动,其中 mega-mHC 值得深入研究。
尚未确认
- 某个 20 层模型中前两层仅使用滑动窗口注意力(SWA):博主疑惑 20 层中只有 2 层用 SWA,对 prefill FLOPs 的节省似乎有限,虽然越少全局注意力确实越便宜,但背后可能有故事,尚无定论。
- 网友对 v4 中 CSA/HCA 双压缩频率交替的设计感到「奇怪」,认为缺乏解释时不如纯 CSA2 方案合理,这属于社区主观评价。
为什么重要
- KV cache 显存占用是当前推理部署的最大瓶颈之一;FP4 直出无退化加上压缩方案,意味着单请求仍需在 HBM/内存中持有 KV cache 完成推理,但请求间的显存压力大幅降低,可能改变推理服务的成本结构。
- 稀疏注意力摆脱稠密热身,配合低 prefill 算力,预示长上下文预训练范式可能转变;在约 500K 超长上下文下,KV cache 的取舍仍是单请求内必须解决的问题。
2026-09-11 ~ 2026-09-11 · 11 条相关
一手来源
- 分析称某新架构设计深度契合推理:prefill 便宜、KV cache 更小 — stochasticchasm ·
- FP4 KV cache 直出无退化,推理工程师有得玩了 — stochasticchasm ·
- 博主解读稀疏注意力训练信号:无需稠密热身或预示训练范式转变 — stochasticchasm ·
- 【源头】分析称某新架构设计深度契合推理:prefill 便宜、KV cache 更小 — stochasticchasm · 2026-09-11
- 观察:推理效率已成当前架构改进的唯一主目标 — stochasticchasm · 2026-09-11
- 架构讨论:纯 CSA2 优于 v4 的 CSA/HCA 双压缩频率设计 — stochasticchasm · 2026-09-11
- 【源头】FP4 KV cache 直出无退化,推理工程师有得玩了 — stochasticchasm · 2026-09-11
- FP4 KV cache 几乎不占显存?推理工程师热议激进压缩方案 — stochasticchasm · 2026-09-11
- 新模型引入 engram 与 mHC 简化,社区追问预训练细节 — stochasticchasm · 2026-09-11
- 【源头】博主解读稀疏注意力训练信号:无需稠密热身或预示训练范式转变 — stochasticchasm · 2026-09-11
- 技术推主分析稀疏注意力长上下文训练:无需稠密预热是好信号 — stochasticchasm · 2026-09-11
- 架构分析:解码器并非跨层读取编码器 KV,只周期读末层状态 — stochasticchasm · 2026-09-11
- 架构细读:解码器周期性读取编码器最终隐状态,而非多层交叉注意力 — stochasticchasm · 2026-09-11
- 前两层为何只用滑动窗口注意力?架构设计引发技术猜想 — stochasticchasm · 2026-09-11