作者称 KDA 低秩 gate 不能解决 attention sink
stochasticchasm · x · 2026-07-28
- 作者指出,随着规模扩大,KDA 的输出 gate 从 低秩 改成了 全秩投影。
- 原本这么设计的理由是缓解 attention sink 问题,但现在这层说法似乎已经被拿掉。
- 他的结论很直接:低秩并不能解决 attention sink,反而在大规模下引入了更多问题。
- 配图展示了论文里关于 gate 变化与归一化/门控细节的说明。
所属事件:Kimi K3 架构解析:引入 SiTU-GLU 与全秩投影(3 条相关)→
「研究」频道最新
- ELEMENTA:用于 UMLIP 训练的大规模 DFT 数据集 — xie_tian · 2026-07-28
- Coding agents 正在改写实证社会科学研究流程 — soumitrashukla9 · 2026-07-28
- Kimi K3 论文披露 SiTU-GLU 与 896 专家 MoE 设计 — KyeGomezB · 2026-07-28
- Aaron Hertzmann 认为大脑不是计算机,AGI 争论再升温 — yacineMTB · 2026-07-28
- 斯坦福用 AI 扫描 5 亿词州法,帮政府清理冗余条文 — StanfordHAI · 2026-07-28
- Kimi K3 的 MoE 路由可能推高专家并行通信 — stochasticchasm · 2026-07-28