Kimi K2.5 扩展方法论
AI寒武纪 · wechat · 2026-07-18
这篇文章回顾了月之暗面 CEO 杨植麟在英伟达 GTC 上关于 Kimi K2.5 背后“扩展方法论”的演讲,主线是把模型能力扩展分成三个维度:token 效率、长上下文、智能体数量。
- token 效率:团队重点讲了 Muon 优化器及其分布式实现,声称可替代 Adam,并在相同 token/参数条件下带来更好的训练效果;同时还用 QKclip 解决了大规模训练时注意力 logit 爆炸、loss 发散的问题。
- 长上下文:提出 KimiLinear / KimiDeltaAttention,用线性注意力与全注意力混合,并把原本标量衰减改成对角矩阵,兼顾短上下文、长输入和长输出任务的效果与效率。
- 智能体蜂群:设计了编排者+子智能体的训练范式,配套实例化奖励、完成奖励和结果奖励,目标是让多个智能体并行协作完成更复杂任务。
文章还提到 K2.5 的几个关键点:
- 训练了超过 15 万亿 token,并在 H800 集群上完成;
- 是首个原生视觉+文本联合训练的开源模型,强调“早期融合”优于先文本后视觉;
- 视觉与文本能力可以互相增强,甚至在几乎不做视觉 SFT 的情况下仍能取得很强表现;
- 演讲末尾还预告了下一代架构方向:把“残差连接”类比为时间维度上的循环结构,再进一步做成“注意力残差”。
所属事件:杨植麟分享 Kimi K2.5 扩展与提效路线(4 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11