Kimi K3 架构解析:放弃 RoPE 引入 KDA 与 LatentMoE
khademinori · x · 2026-07-30
推文探讨了 Kimi K3 模型在架构设计上的关键取舍及其带来的性能提升。
- 核心架构:K3 完全放弃了 RoPE(旋转位置编码),尽管其原作者参与了该模型研发。取而代之的是 Kimi Delta Attention (KDA),它本质上是一个循环且基于内容寻址的矩阵状态 RNN,使得 token 在进入全局 MLA 之前就已具备顺序感知能力。
- 组件升级:相比此前的 Kimi Linear 模型,K3 新引入了 LatentMoE 组件(类似于 Nemotron 3 Ultra 的设计),通过下投影压缩大型线性层。
- 规模化验证:K3 成功将 Kimi Linear 的研究架构(从 480 亿参数)扩展至生产级前沿模型(2.8 万亿参数),证明了该架构在极端规模下的有效性。
所属事件:Kimi K3 架构解析:2.8万亿参数与主动遗忘机制(2 条相关)→
「模型」频道最新
- KOL 驳斥「DeepSeek 错失 Agent 浪潮」:实测打脸 — teortaxesTex · 2026-07-31
- DeepSeek 被赞为唯一推动 API 降价的厂商 — teortaxesTex · 2026-07-31
- Redis 作者推进本地运行模型 DwarfStar — antirez · 2026-07-31
- SOTA模型行为观察:要求修错别字时总爱擅自重写 — mitsuhiko · 2026-07-31
- DeepSeek-V4-Flash 正式版上线,Agent 能力逼近 Opus 4.8 — 机器之心 · 2026-07-31
- 通义千问发布 Qwen-Audio-3.0-ASR-Flash,强化热词与领域识别 — Alibaba_Qwen · 2026-07-31