Kimi K2.5 扩展方法论

AI寒武纪 · wechat · 2026-07-18

这篇文章回顾了月之暗面 CEO 杨植麟在英伟达 GTC 上关于 Kimi K2.5 背后“扩展方法论”的演讲,主线是把模型能力扩展分成三个维度:**token 效率、长上下文、智能体数量**。 - **token 效率**:团队重点讲了 Muon 优化器及其分布式实现,声称可替代 Adam,并在相同 token/参数条件下带来更好的训练效果;同时还用 **QKclip** 解决了大规模训练时注意力 logit 爆炸、loss 发散的问题。 - **长上下文**:提出 **KimiLinear / KimiDeltaAttention**,用线性注意力与全注意力混合,并把原本标量衰减改成对角矩阵,兼顾短上下文、长输入和长输出任务的效果与效率。 - **智能体蜂群**:设计了编排者+子智能体的训练范式,配套实例化奖励、完成奖励和结果奖励,目标是让多个智能体并行协作完成更复杂任务。 文章还提到 K2.5 的几个关键点: - 训练了超过 **15 万亿 token**,并在 H800 集群上完成; - 是首个**原生视觉+文本联合训练**的开源模型,强调“早期融合”优于先文本后视觉; - 视觉与文本能力可以互相增强,甚至在几乎不做视觉 SFT 的情况下仍能取得很强表现; - 演讲末尾还预告了下一代架构方向:把“残差连接”类比为时间维度上的循环结构,再进一步做成“注意力残差”。

所属事件:杨植麟分享 Kimi K2.5 扩展与提效路线(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →