Moonshot Kimi K3 报告主打稀疏 MoE 与 Delta Attention
SumitGup · x · 2026-07-26
Moonshot AI 的 Kimi K3 技术报告强调:更大的稠密模型并不是未来,核心思路是用稀疏路由、Delta Attention、Attention Residuals、100 万 token 上下文和高效扩展,换取更强的代码能力与更低推理成本。
- 稀疏 MoE 路由:896 个专家里,每个 token 只激活 16 个。
- Delta Attention:只关注上下文中的变化部分,避免全量重算。
- Attention Residuals:在层间保留有用信息,减少反复重建表示。
- 1M 上下文:目标是让整个代码仓库、书籍、论文放进一个会话。
- 高效扩展:追求前沿代码性能,但不把推理成本一起推高。
所属事件:Moonshot AI 发布万亿参数模型 Kimi K3(2 条相关)→
「模型」频道最新
- Gary Marcus:视频理解只在训练相似输入下才算可靠 — GaryMarcus · 2026-07-26
- Google 搜索页广告增至 5 条以上,疑受 AI Overviews 影响 — mobileraj · 2026-07-26
- Flux 3 用极模糊提示也能生成连贯对白视频 — cocktailpeanut · 2026-07-26
- SemiAnalysis 认为 Google 算力外包拖慢了 Gemini — firstadopter · 2026-07-25
- GPT 5.6 Sol 只靠几句提示词就做出可运行 3D 游戏 — Angaisb_ · 2026-07-25
- Google Gemma 开放权重模型被赞适合工业微调 — clmt · 2026-07-25