Kimi K3 用三轴架构宣称提升 2.5 倍扩展效率
suchenzang · x · 2026-07-28
Kimi K3 的架构围绕三个维度扩展信息流:序列长度、网络深度和模型宽度。
- 序列长度:用 Hybrid Attention,把 3 层 Kimi Delta Attention 和 1 层 Gated MLA 组合到每个 block 里,增强长上下文 token 混合能力。
- 深度:Attention Residuals 让模块可从 embedding、当前 block 和前序 block 中选择性取回表示。
- 宽度:Stable LatentMoE 负责稀疏通道混合,每个 token 激活 896 个路由专家中的 16 个。
- 多模态路径:MoonViT-V2 先编码图像/视频,再由轻量 projector 映射到共享 embedding 空间。
- 效果:配合改进的训练与数据配方,以及 Per-Head Muon,论文声称整体 scaling 效率比 Kimi K2 提升约 2.5 倍。
所属事件:月之暗面发布 Kimi K3 技术报告,宣称训练效率提升 2.5 倍(6 条相关)→
「研究」频道最新
- Celltype 要做预测生物反应的 LLM,并在纽约招研究工程师 — david_van_dijk · 2026-07-28
- Claude Opus 5 维持 4.8 版定价,编码表现逼近 Fable 5 — AlexKim · 2026-07-28
- 探讨 MLA 架构细节:全秩门投影会否引发参数爆炸? — stochasticchasm · 2026-07-28
- Kimi K3 将 KDA 输出 gate 改为输入依赖的全秩投影 — stochasticchasm · 2026-07-28
- OpenAI agent 测试被指含不可解任务与黑客风险警告 — dhadfieldmenell · 2026-07-28
- Kimi K3 架构因 KDA、AttnRes 和 gated MLA 获好评 — stochasticchasm · 2026-07-28