Kimi K3 把 KDA gate 改成全秩,低秩被指没解决 attention sink
suchenzang · x · 2026-07-28
- 作者称,随着 Kimi K3 扩展,KDA 的输出 gate 从 Kimi Linear 里的低秩参数化,改成了 输入相关的全秩投影。
- 之前低秩设计的理由之一,是缓解 attention sink 问题。
- 但在这篇解读里,作者认为这个理由已经不成立:低秩并没有真正解决 attention sink。
- 配图中的论文段落还提到,模型引入了 lower-bounded decay,并通过进入 log-space、sigmoid 截断等方式处理有限精度和小分母带来的数值稳定性问题。
所属事件:Kimi K3 优化 KDA 机制:设下界防溢出并升级全秩 gate(2 条相关)→
「研究」频道最新
- ELEMENTA:用于 UMLIP 训练的大规模 DFT 数据集 — xie_tian · 2026-07-28
- Coding agents 正在改写实证社会科学研究流程 — soumitrashukla9 · 2026-07-28
- Kimi K3 论文披露 SiTU-GLU 与 896 专家 MoE 设计 — KyeGomezB · 2026-07-28
- Aaron Hertzmann 认为大脑不是计算机,AGI 争论再升温 — yacineMTB · 2026-07-28
- 斯坦福用 AI 扫描 5 亿词州法,帮政府清理冗余条文 — StanfordHAI · 2026-07-28
- Kimi K3 的 MoE 路由可能推高专家并行通信 — stochasticchasm · 2026-07-28