Baseten 工程师拆解 Kimi K3:七年迭代不是只靠堆参数
khademinori · x · 2026-07-28
一位 Baseten 工程师花了 48 小时拆解 Kimi K3 的建模代码,核心结论不是“只靠堆参数”。
- 这篇分析用“K3 里能塞下 22580 个 GPT-2”来强调七年间模型规模的爆炸式增长,但同时指出:K3 的进步主要来自一连串定向修 bug,而非单纯放大参数。
- 文章梳理了从 GPT-2 → 线性注意力 → DeltaNet → 门控 DeltaNet → Kimi 自研 KDA 注意力 的演进路线。
- 每一代改动都对应解决上代的具体问题:内存不够、信息干扰、无法选择性遗忘、残差稀释 等。
- 这条帖子的重点还在于开源的威力:代码一放出,全世界的工程师就能迅速把七年的技术脉络拆清楚,闭源模型则很难获得这种外部“集体逆向工程”。
所属事件:深度长文梳理七年架构演进,解读 Kimi K3 不止于堆参数(5 条相关)→
「模型」频道最新
- Tiron 作为开源权重模型发布,主打多人会议转写 — Balance- · 2026-07-28
- 团队弃用 Anthropic Max,转投 Codex 和国产模型 — haider1 · 2026-07-28
- Anthropic 为 Claude Opus 5 发布官方提示词指南 — JarnoDuursma · 2026-07-28
- DeepSeek V4 GA 传闻指向 NDA 严控,发布前仍是黑盒 — teortaxesTex · 2026-07-28
- Reddit 讨论 KIMI-K3 通过 OpenRouter 是否仍有护栏 — Suhan_XD · 2026-07-28
- Kimi K3 的 1.6TB 权重背后,或是 20–40 万亿 tokens — johnseach · 2026-07-28