Kimi K3 去掉 RoPE 改用 NoPE,KDA 仍在编码顺序
cedric_chee · x · 2026-07-29
Kimi K3 据称去掉了所有 RoPE 层,改用 NoPE,但这并不意味着模型“完全不知道位置”。
- KDA 是递归式的:它更像一种内容可寻址的矩阵状态 RNN,而不是传统 softmax attention。模型维护紧凑的 fast-weight memory,并用类似 delta rule 的方式更新。
- 顺序信息是隐式编码的:门控、衰减机制和 causal masking 一起,让模型仍然能感知先后顺序与新近性。
- MLA 负责全局检索:在没有显式位置编码的情况下,MLA 提供内容级的全局信息检索。
- 层级堆叠有设计:帖子提到 K3 在每个 gated MLA 层之前放了 3 层 KDA(包括第一层之前也有 3 层),因此 token 在进入检索层前已经带有顺序感知表示。
所属事件:Kimi K3 架构突破:移除 RoPE 改用 NoPE(3 条相关)→
「模型」频道最新
- 中美前沿模型差距是否在稳定,引发新一轮争论 — teortaxesTex · 2026-07-29
- 微软 Mage-Flow 模型从 HF 消失,社区镜像仍在 — pmttyji · 2026-07-29
- Liquid AI 将讲端侧 agentic 模型,并讨论 harness 协同设计 — maximelabonne · 2026-07-29
- 用户在讨论 Opus 5 除了写代码还能做什么 — remilouf · 2026-07-29
- Anthropic暗示已实现递归自我改进,呼吁控制前沿速度 — daniel_mac8 · 2026-07-29
- Claude Opus 5 在 DeepSWE 夺魁,号称成本还低 28% — daniel_mac8 · 2026-07-29