Kimi K3 报告称效率提升 2.5 倍,104B 激活参数支持百万上下文
burny_tech · x · 2026-07-28
- 月之暗面发布了 Kimi K3 的技术报告,主打同时扩展三条轴:长上下文、深度、宽度。
- 报告称模型采用 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE,整体缩放效率相比 Kimi K2 提升约 2.5 倍。
- 该模型总参数约 2.8T,激活参数 104B;不使用 RoPE,而是用 NoPE + recurrent decay gates 来维持位置结构,把上下文扩到 100 万 token,且无需重新调位置嵌入。
- 视觉部分从零训练编码器,采用 next-token prediction,报告称比从 SigLIP 起步更稳定,同时保持视觉评测表现。
- 后训练阶段还使用 MOPD,把 9 个 经过 RL 训练的专项教师模型合并成一个统一模型。
所属事件:Kimi K3 技术报告解读:2.8T MoE 与架构效率突破(49 条相关)→
「模型」频道最新
- Opus 5 体验:技术极强但对话僵硬,更适合做智能体而非创意助手 — MicahBerkley · 2026-07-28
- 月之暗面开源 Kimi K3:2.8T 参数 MoE,原生视觉与百万上下文 — max_paperclips · 2026-07-28
- Kimi K3 在利用开发上胜过 GLM-5.2,但端到端仍未攻成 — kevinsxu · 2026-07-28
- 大模型更像“智慧”,推理努力更像“勤奋” — breath_mirror · 2026-07-28
- 微软发布自研AI安全模型,关键测试超越GPT且成本减半 — MichaelFNunez · 2026-07-28
- 实测对比:K3等模型推理token极易耗尽预算 — MaziyarPanahi · 2026-07-28