分析称 Kimi 新版小版本升级竟重做全量预训练,采用两阶段训练
stochasticchasm · x · 2026-09-22
作者在分析 Kimi 新版本(k3)的训练配置时指出两点反常:
- 小版本号升级却用相同架构与形状做了一次完整的全新预训练,作者认为这更像一次「数据版本升级」而非架构变更。
- 训练从单阶段全模态(omni-modality)改为两阶段(2-phase),且大模型几乎没有吃到 phase-2 的 omnimodal 数据配比,大小模型数据出现明显错配。
作者据此推测产品定位:flash 档更像类 Gemini Flash 的多模态数据处理引擎,pro 档则是冲 SWE-bench 的编码强模型。
所属事件:分析称 xAI 与 Kimi 训练中途切换 Muon 优化器(3 条相关)→
「模型」频道最新
- DFlash2 搭配 GLM 5.3 Flash 处理超长 prompt 会出问题 — TheZachMueller · 2026-09-22
- 「MiMo 首创大规模 MOPD」:圈内热议 MiMo-V2.6 向 DeepSeek 叫板 — teortaxesTex · 2026-09-22
- 数字母测试翻车不冤:Jev 逐字母输入 strawberry 时 168/168 全对 — BLUECOW009 · 2026-09-22
- MiMo-V2.6 疑为开源界最大单次 RL 训练,罗福莉称难度超 DeepSeek R1 — teortaxesTex · 2026-09-22
- 博主自纠:落地 SF 发现真正惊喜是 MiMo-2.6,胜过 Grok 4.7 且更便宜 — kimmonismus · 2026-09-22
- cHHillee 力挺 Tinker:托管训练也能拥有自己的 post-training 代码 — cHHillee · 2026-09-22