Moonshot Kimi K3 长上下文路线遭质疑:1M 扩展成焦点
teortaxesTex · x · 2026-07-21
这条讨论聚焦 Kimi K3 / Moonshot 的长上下文路线是否走对了:作者认为 Moonshot 在 2024 年 3 月就已经做到 200 万上下文,但在 R1 之后转向 MLA,可能在 26.2 万以上的超长上下文扩展上并不理想,进一步追问 KDA 是否真能像 CSA+HCA 一样顺利扩到 100 万。
配图里还展示了 Kimi K3 的结构示意,包括 Stable LatentMoE、Gated MLA、KDA 以及 Kimi Delta Attention 主干。整条讨论把“长上下文”类比成 AI 时代的 RAM,并引申出一个观点:真正的优势未必只是模型本身,也可能是围绕这条路线的组织能力。
「模型」频道最新
- Gemma 在开放权重生态里还需要更大的基础模型 — _xjdr · 2026-07-27
- 开发者呼吁谷歌:下一代Gemma请做1T参数基座模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27