Kimi K3 scaling 研究显示 cosine decay 优于 WSD
stochasticchasm · x · 2026-07-28
Kimi K3 的 scaling 研究更偏向 cosine decay
这条帖子指向论文里的 scaling-law 部分。作者表示,架构、数据和训练上的一系列改动,合起来让 Kimi K3 相比 Kimi K2 的整体 scaling 效率提升了约 2.5 倍。
具体结论包括:
- 他们重新调了 batch size、学习率、tokens-per-parameter ratio(TPP) 和模型形状等关键超参。
- 在各自最优超参下,cosine decay 持续优于 Warmup Stable Decay(WSD)。
- 作者强调,WSD 过去可能表现不错,但两种 schedule 对超参的最优区域差异很大,因此不能用同一套超参直接硬比。
- 帖子里的图也显示,在各自最佳配置下,cosine decay 的最终 loss 更低。
所属事件:Kimi K3 技术报告解析:三轴架构与混合注意力(35 条相关)→
「研究」频道最新
- NeurIPS 2026 MATH-AI 征稿,聚焦智能体数学推理 — KaiyuYang4 · 2026-07-28
- 同一模型规格,不同 coding agent 给出差异估计 — JessicaHullman · 2026-07-28
- 渐进式上下文扩展更适合线性注意力混合模型 — stochasticchasm · 2026-07-28
- Google DeepMind 认为 LLM 会证明定理却不会科学跳跃 — kylekabasares · 2026-07-28
- CMU 的 O-VAD 通过物体状态追踪做工业异常检测 — CarnegieMellonU · 2026-07-28
- Latent Action Model 讲座将演示如何仅靠观察学会超级马里奥 — ceciletamura · 2026-07-28