Kimi K3 论文透露混合注意力与自研 Kimi Linear

peterjliu · x · 2026-07-28

Kimi K3 可能采用了混合注意力和自研 Kimi Linear

这条帖子根据 Kimi K3 论文指出:模型似乎采用了混合的线性注意力 / 全注意力设计,并且使用了自家的 Kimi Linear 变体,作者提到其宣称表现优于全注意力。

帖子认为,这可能是首个被确认采用混合注意力的前沿模型;同时也强调,这类做法在主线前沿模型里非常少见,因为它明显偏离了传统 Transformer 路线。作者还提到,论文里似乎直接去掉了位置编码/位置嵌入。

整体上,这被解读为 Moonshot 对小规模扩展结果有很强信心,才敢把这种架构创新放进主模型。

所属事件:Kimi K3 架构深度解析:2.8T参数与注意力机制革新(16 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →