Kimi K3 技术报告显示缩放效率较 Kimi K2 提升 2.5 倍

stochasticchasm · x · 2026-07-28

这张图来自 Kimi K3 的技术报告,核心信息有两点:

表格还显示,它采用了更大的 MoE 结构、更多 routed experts、更多 attention heads,以及新的 hybrid KDA–MLA 注意力机制。

所属事件:Kimi K3 技术报告解析:三轴架构与混合注意力(34 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →