Kimi K3 报告加入 NoPE、全秩门控与 FP32 训练
suchenzang · x · 2026-07-28
这条线程在拆解 Kimi K3 技术报告里的几项关键设计变化:
- MLA 继续使用 NoPE,作者顺带吐槽位置编码信息似乎“全局都没那么重要”。
- 新增了一个带 sigmoid 的输出门控,目的看起来是增强信号传播、尽量避免训练不稳定。
- 为了修正 flash attention 里的舍入误差,训练时把 attention 输出保留在 FP32。
- 由于 FP32 会增加显存占用,团队重写了训练 kernel,用 KV staging buffers 去重叠这部分开销,从而把吞吐拉回来。
- 续帖还提到,KDA 的输出门控从 low-rank 改成了 full-rank,而且这种改法并没有真正解决原本想缓解的 attention sink 问题。
所属事件:月之暗面发布 Kimi K3 技术报告,宣称训练效率提升 2.5 倍(8 条相关)→
「模型」频道最新
- Kimi K3 报告称缩放效率比 K2 提升 2.5 倍 — ricklamers · 2026-07-28
- Moonshot 发布 Kimi K3:2.8T MoE、1M 上下文和 2.5 倍效率提升 — joeddav · 2026-07-28
- Kimi K3 已可在 Fireworks 上推理与训练 — omarsar0 · 2026-07-28
- Gemini 视频生成会乱加词,还会拦截部分无害提示 — Individual-Cookie615 · 2026-07-28
- Polymarket 估算下月内发布新 Claude Sonnet 概率为 42% — Polymarket · 2026-07-28
- Kimi K3 论文披露 SiTU-GLU 与 896 专家 MoE 设计 — KyeGomezB · 2026-07-28