Kimi K3 从头训练 MoonViT-V2 来稳定多模态训练
nrehiew_ · x · 2026-07-29
这条补充了 Kimi K3 多模态里视觉塔的关键变化:MoonViT-V2 完全从头训练。
- 过去,包括 Kimi K2.5,通常会用 SigLIP 这类对比学习模型初始化视觉编码器。
- K3 的做法是把视觉编码器直接和 LLM 一起做联合优化,目标是 next-token prediction。
- 他们认为预训练视觉塔接到 LLM 上后,联合优化更容易不稳定;而 MoonViT-3D 在 SigLIP 初始化时会出现更频繁的梯度尖峰。
- 相比之下,MoonViT-V2 训练更稳定。
- 作者还表示,MoonViT-V2 在视觉评测上能追平基线,这意味着大规模多模态模型未必需要对比预训练做初始化。
所属事件:Kimi K3 技术报告深度解读:架构与训练系统全面曝光(18 条相关)→
「模型」频道最新
- Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2 — elonmusk · 2026-07-29
- 一张爆图对比 12 类付费 AI 工具与免费替代品 — nikola_mr64990 · 2026-07-29
- Verdent 携手月之暗面,为 2.8T 参数 Kimi K3 优化编程工作流 — PrajwalTomar_ · 2026-07-29
- 120B 参数内最强本地模型求推荐:Qwen 系列仍是唯一解? — Possible_Grocery8079 · 2026-07-29
- OpenMed 发布开源医疗 AI 框架,结合 Kimi 本地处理临床数据 — MaziyarPanahi · 2026-07-29
- 教授实测 Flux 3:复杂提示词还原度极高 — emollick · 2026-07-29