Kimi Linear: An Expressive, Efficient Attention Architecture
Kimi Team, Yu Zhang, Zongyu Lin, Xingcheng Yao, Jiaxi Hu, Fanqing Meng, Chengyin Liu, Xin Men, Songlin Yang, Zhiyuan Li, Wentao Li, Enzhe Lu, Weizhou Liu, Yanru Chen, Weixin Xu, Longhui Yu, Yejie Wang, Yu Fan, Longguang Zhong, Enming Yuan, Dehao Zhang, Yizhi Zhang, T. Y. Liu, Haiming Wang, Shengjun Fang, Weiran He, Shaowei Liu, Yiwei Li, Jianlin Su, Jiezhong Qiu, Bo Pang, Junjie Yan, Zhejun Jiang, Weixiao Huang, Bohong Yin, Jiacheng You, Chu Wei, Zhengtao Wang, Chao Hong, Yutian Chen, Guanduo Chen, Yucheng Wang, Huabin Zheng, Feng Wang, Yibo Liu, Mengnan Dong, Zheng Zhang, Siyuan Pan, Wenhao Wu, Yuhao Wu, Longyu Guan, Jiawen Tao, Guohong Fu, Xinran Xu, Yuzhi Wang, Guokun Lai, Yuxin Wu, Xinyu Zhou, Zhilin Yang, Yulun Du
cs.CL, cs.LG
2025-10-31
Moonshot 的 Kimi Delta Attention 配 3 比 1 全注意力混合,在等算力 1.4T 训练下短长上下文与 RL 全线超全注意力,KV 缓存省 75%、1M 解码快 6.3 倍。
大模型走向 agent 与 RL 的 test-time scaling,推理阶段要在超长轨迹上反复解码,softmax 注意力的两个老毛病就成了硬约束:计算量随上下文平方增长,KV cache 随长度线性膨胀,吞吐、上下文长度、实时交互全被卡住。
线性注意力能把复杂度降下来,但一直在质量上输给 softmax,根子在于它用一块固定大小的 recurrent state 当记忆(论文叫 finite-state RNN memory),长序列检索本来就在理论上吃亏。最近两件事把差距缩小了:门控/衰减机制,以及 delta rule(DeltaNet)。纯线性结构的天花板还是那块有限记忆,于是行业转向混合:大部分层用快的线性注意力,夹几层全局 softmax 注意力兜底。问题是此前的混合模型要么没做到足够规模,要么评测不全,能不能真正在质量上追平甚至超过全注意力,一直没被严格回答。
Kimi Linear 的核心是 Kimi Delta Attention(KDA)。要理解它得先回到 DeltaNet:把线性注意力的状态更新看成对「键→值」映射做在线梯度下降,也就是 delta rule,状态会不断自我修正,但旧关联永远不擦除。Gated DeltaNet 在此之上加了一个标量遗忘门 α,相当于给 fast weight 加 weight decay。
KDA 的改动,是把那个标量门换成通道级门:每个特征维度有自己独立的遗忘率,而不是整个 head 共用一个粗门。打个比方,GDN 是一盏整屋开关,KDA 是每盏灯单独调。粒度变细,对有限 RNN 记忆的进出管理就更精确。为把这个细粒度门算得快,KDA 把转移矩阵参数化成 DPLR(Diagonal-Plus-Low-Rank,对角加低秩)的一个特化变体,配一套定制的 chunkwise 并行算法,相比通用 DPLR 省算力,又仍然贴合经典 delta rule。
架构上,Kimi Linear 是层间混合:每 3 层 KDA 配 1 层全注意力(MLA),比例 3:1。底座沿用 Moonlight 的 MoE,48B 总参、3B 激活(256 个专家里激活 8 个,外加 1 个共享专家,首层是 dense)。一个反直觉的选择是全注意力层用 NoPE,即不加位置编码,把编码位置和新近偏置的活儿整个交给 KDA,论文论证 KDA 本身就是一组可学习的位置嵌入。其余配件包括 Sigmoid 输出门、short conv、head-wise RMSNorm。
所有对照都在同一架构、同参数量、同训练配方下做(1.4T tokens),这是这篇结论能立住的前提。短上下文预训练(KDA vs 全 MLA vs 混合 GDN-H):
| 指标 | 全 MLA | GDN-H | Kimi Linear |
| MMLU-Pro | 47.2 | 47.9 | 51.0 |
| MMLU | 71.6 | 72.2 | 73.8 |
| BBH | 71.6 | 70.6 | 72.9 |
SFT 之后 GPQA-Diamond 拿到 62.1,高于 MLA 的 57.1 和 GDN-H 的 58.6。长上下文(128k)上 RULER 84.3(MLA 81.3、GDN-H 80.5),八项平均 54.5,全场最高。RL 阶段用同一套数学 RLVR,Kimi Linear 在 MATH500、AIME 2025 上收敛更快、终点更高。
效率才是真正的卖点。长序列生成 KV cache 最高省 75%;1M 上下文解码吞吐快 6.3 倍(每 token 时延 1.84ms,MLA 是 11.48ms),prefill 在 1M 序列快 2.9 倍。KDA 的细粒度门几乎没有给 prefill 带来额外开销,曲线和 GDN-H 几乎重合。
这是第一次有混合线性注意力在公平比较下,在短上下文、长上下文、RL 三种场景里都赢过全注意力。对从业者意味着:在 agent、长输出这类解码密集型场景,Kimi Linear 是一个真能直接替换全注意力的架构,既快又省,质量还不掉。代码、vLLM 实现、3B/48B 的预训练和指令微调 checkpoint 都开源了,可以直接拿来跑。它也佐证了一个趋势:线性注意力只要门控做得够细,配上少量全局注意力兜底,质量天花板可以高过 softmax。
「赢过全注意力」的前提是等算力、等配方。1.4T tokens 的对照里,Kimi Linear、MLA、GDN-H 用的是同一家族、同规模的底座,不是和 GPT 级外部模型比。最终发布版 Kimi Linear 用了 5.7T tokens 训练,和 Moonlight 比,但论文主体结论来自 1.4T 的内部对照。短上下文上也有几处没赢:EvalPlus、MATH500 略低于 GDN-H。长上下文的 LongBench V2 和 Frames 也没改善。RL 对照只和 MLA 比,没有 GDN-H。KDA 的细粒度门和 DPLR 特化增加了实现复杂度,虽然有开源 kernel,复现门槛仍比标准 attention 高。这些都是在「赢过全注意力」大标题下容易被略过的注脚。