Kimi Delta Attention 将 KV cache 压低 75% 并提速 6 倍

johnseach · x · 2026-07-27

Kimi Delta Attention 如何支撑百万上下文

这条帖子拆解了 Moonshot/Kimi K3 的长上下文核心:Kimi Delta Attention(KDA) 并不是简单“堆更多参数”,而是用一种更高效的记忆机制来替代传统注意力的 KV cache 膨胀。

帖中给出的结果是:在百万 token 上下文下,KV cache 最多可减少约 75%,解码速度最多可提升约 6 倍,同时在 Moonshot 的内部测试里维持或超过全注意力质量。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →