推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点

9 月 11 日,技术博主 stochasticchasm 连续发帖细读某新公布的模型架构博客,得出核心判断:当前架构改动几乎已把推理效率作为唯一目标,是一次典型的「inference-informed design」——prefill 便宜、KV cache 极小、对 prefill-decode 分离(PD disagg)部署友好,大批量 prefill 下能拿到不错的利用率。

已确认

尚未确认

为什么重要

2026-09-11 ~ 2026-09-11 · 11 条相关

一手来源