MoonViT-V2 让 Kimi K3 视觉编码器从零训练并改用 next-token prediction
stochasticchasm · x · 2026-07-28
图里讨论的是 MoonViT-V2:一个用 next-token prediction、从零训练 的视觉编码器。
- 关键变化在于,Kimi K3 的视觉编码器不再像 Kimi K2.5 那样从 SigLIP 这类对比学习预训练模型初始化。
- 文中认为,预训练编码器接入大模型后,联合优化更容易不稳定;而 MoonViT-V2 在训练中表现出更低的梯度范数和更少的尖峰。
- 采用 next-token prediction 后,编码器表征可以直接被语言模型目标塑形,而不是被对比损失优先拉向全局语义。
- 图中还称 MoonViT-V2 在视觉评测上与 SigLIP 初始化的基线相当,暗示在大规模多模态语言模型里,对比预训练未必是必须的。
所属事件:月之暗面发布 Kimi K3 技术报告,宣称训练效率提升 2.5 倍(33 条相关)→
「多模态」频道最新
- Invideo Agent One 只靠对话做出一支电影预告片 — LudovicCreator · 2026-07-28
- NKD VFX Tools 更新加入 3D 预览和镜头畸变节点 — Nekodificador · 2026-07-28
- Midjourney 8.2 生成 Zendaya 黑白纽约时尚街拍 — michaelrabone · 2026-07-28
- Higgsfield 公开 Originals 的完整制作蓝图 — mhdfaran · 2026-07-28
- Civitai 图像编辑模型实测翻车,连编辑都没跑通 — cradledust · 2026-07-28
- TRELLIS.2 INT8 ConvRot 已能在 AMD ROCm 上原生跑 ComfyUI — DrBearJ3w · 2026-07-28