Reddit 长文拆解 Kimi K3 背后的 MoE 和长上下文栈
MohamedKadri_ · reddit · 2026-07-27
这条 Reddit 帖发了一个面向非技术读者的 MoE 长文解释,重点拆解 Kimi K3 背后的稀疏激活与长上下文成本:正文附了两张图,分别用“2.8T 总参数、约 2% 激活参数”和“路由器挑选少数专家”的方式解释 MoE 机制。
文章覆盖了几条主线:
- MoE 稀疏化竞赛:从 Mixtral、DeepSeek-V3,到 Llama 4 Maverick、gpt-oss-120b,再到 K3 的公司口径“896 个专家里激活 16 个”;
- 专家不是固定学科专家:更像是对缩进、Python 里的 self、语法模式等模式进行路由;
- KV cache 才是长上下文大头:作者用 V3 的公开维度算出,标准 MHA 下一个 32k token 对话大约要 131 GB;
- MLA / KDA:MLA 相比前代模型把 cache 压缩了 93.3%,KDA 则通过固定大小状态、按通道遗忘和 3:1 混合机制,号称最多再减 75%。
作者说明这些类比和表述参考了社区讨论,并附上原论文链接和逐条映射,便于读者核对。
「模型」频道最新
- 用户吐槽 Opus 5 能力严重降级:满嘴胡言还算错题 — whatsallthiss · 2026-07-27
- Reddit 讨论本地编程模型怎么选,重点是规划和推理 — naunen · 2026-07-27
- GPT-5.6 Sol 在双仓库基准中修复 105 个隐藏 bug 里的 31 个 — PawelHuryn · 2026-07-27
- Opus 5 刷爆 ARC-AGI-3?遭硬核打假:疑似背诵答案而非真实推理 — scaling01 · 2026-07-27
- Inkling 在更自然提示下仍会反撩用户 — ChowdhuryNeil · 2026-07-27
- 泄露称 Kimi K3.1 接近 GPT-5.6,推理更快还保留开源权重 — iamaliveix · 2026-07-27