Kimi K3 技术报告显示缩放效率较 Kimi K2 提升 2.5 倍
stochasticchasm · x · 2026-07-28
这张图来自 Kimi K3 的技术报告,核心信息有两点:
- Scaling 效率提升:图中标注 Kimi K3 相比 Kimi K2 取得了 2.5× 的 scaling efficiency 提升。
- 架构升级:Kimi K3 的总参数从 1.04T 增至 2.78T,激活参数从 32.6B 增至 104.2B,训练上下文长度从 128K 提升到 1M。
表格还显示,它采用了更大的 MoE 结构、更多 routed experts、更多 attention heads,以及新的 hybrid KDA–MLA 注意力机制。
所属事件:Kimi K3 技术报告解析:三轴架构与混合注意力(34 条相关)→
「研究」频道最新
- Kimi K3 用 Stable LatentMoE 稳住 896 专家 MoE — suchenzang · 2026-07-28
- NeurIPS 2026 MATH-AI 征稿,聚焦智能体数学推理 — KaiyuYang4 · 2026-07-28
- 同一模型规格,不同 coding agent 给出差异估计 — JessicaHullman · 2026-07-28
- 渐进式上下文扩展更适合线性注意力混合模型 — stochasticchasm · 2026-07-28
- Google DeepMind 认为 LLM 会证明定理却不会科学跳跃 — kylekabasares · 2026-07-28
- CMU 的 O-VAD 通过物体状态追踪做工业异常检测 — CarnegieMellonU · 2026-07-28