Kimi K2.5 扩展方法论
AI寒武纪 · wechat · 2026-07-18
这篇文章回顾了月之暗面 CEO 杨植麟在英伟达 GTC 上关于 Kimi K2.5 背后“扩展方法论”的演讲,主线是把模型能力扩展分成三个维度:**token 效率、长上下文、智能体数量**。 - **token 效率**:团队重点讲了 Muon 优化器及其分布式实现,声称可替代 Adam,并在相同 token/参数条件下带来更好的训练效果;同时还用 **QKclip** 解决了大规模训练时注意力 logit 爆炸、loss 发散的问题。 - **长上下文**:提出 **KimiLinear / KimiDeltaAttention**,用线性注意力与全注意力混合,并把原本标量衰减改成对角矩阵,兼顾短上下文、长输入和长输出任务的效果与效率。 - **智能体蜂群**:设计了编排者+子智能体的训练范式,配套实例化奖励、完成奖励和结果奖励,目标是让多个智能体并行协作完成更复杂任务。 文章还提到 K2.5 的几个关键点: - 训练了超过 **15 万亿 token**,并在 H800 集群上完成; - 是首个**原生视觉+文本联合训练**的开源模型,强调“早期融合”优于先文本后视觉; - 视觉与文本能力可以互相增强,甚至在几乎不做视觉 SFT 的情况下仍能取得很强表现; - 演讲末尾还预告了下一代架构方向:把“残差连接”类比为时间维度上的循环结构,再进一步做成“注意力残差”。
所属事件:杨植麟分享 Kimi K2.5 扩展与提效路线(4 条相关)→
「模型」频道最新
- Qwen3.8 预览版再升级 — cedric_chee · 2026-07-20
- LLM 已能做前沿数学反证 — ctjlewis · 2026-07-20
- Qwen3.8 预览版更新 — Alibaba_Qwen · 2026-07-20
- LLM已在自动研究,差距或再拉大 — teortaxesTex · 2026-07-20
- Kimi 需求暴涨:便宜AI反而拉高算力 — vaibhavbetter · 2026-07-20
- 传闻:Opus 5 将是 Anthropic 下一步 — kimmonismus · 2026-07-20