Kimi K3 用 -5 下界锁住衰减,避免 chunkwise KDA 溢出
suchenzang · x · 2026-07-28
这条线程在梳理 Kimi Linear / KDA 的 chunk-wise 形式时,重点解释了 Kimi K3 新增的 lower-bounded decay 设计,以及它为何能改善有限精度下的计算问题。
核心变化
- Kimi Linear 里,log-decay 使用的是无下界的 negative-Softplus 映射。
- Kimi K3 改用缩放 sigmoid,把 log-decay 下界固定住。
- 文中给出的 gmin = -5 让累计衰减落在 BF16 可承受范围 内,避免数值溢出。
计算上的意义
- 在 Kimi Linear 中,diagonal tiles 仍需要显式的 position-pair 计算。
- 在 Kimi K3 中,受限的 decay 范围让对角块和非对角块都能走 dense Tensor Core 矩阵乘法。
- 结果就是把 chunkwise KDA 里的 position-pair 对角瓶颈消掉了。
作者也补充说,forget-gate / weight-decay 相关思路并不新,但这次的重点是这种参数化如何改变计算路径与数值稳定性。
所属事件:Kimi K3 优化 KDA 机制:设下界防溢出并升级全秩 gate(2 条相关)→
「研究」频道最新
- Coding agents 正在改写实证社会科学研究流程 — soumitrashukla9 · 2026-07-28
- 作者再谈 open weights:它们并不等于开源 — aronchick · 2026-07-28
- 作者称 KDA 低秩 gate 不能解决 attention sink — stochasticchasm · 2026-07-28
- Kimi K3 论文披露 SiTU-GLU 与 896 专家 MoE 设计 — KyeGomezB · 2026-07-28
- Aaron Hertzmann 认为大脑不是计算机,AGI 争论再升温 — yacineMTB · 2026-07-28
- 斯坦福用 AI 扫描 5 亿词州法,帮政府清理冗余条文 — StanfordHAI · 2026-07-28