Kimi K3 视觉编码器从头训练,称视觉评测更强
nrehiew_ · x · 2026-07-29
这条讲的是 Kimi K3 的原生多模态设计。
- K3 不是先单独训练视觉编码器,而是把整套系统 从头一起训练,用的是 next-token prediction。
- 作者说这种做法在 vision evaluations 上超过了基线。
- 配图里还对比了 Kimi K2 和 K3 的 scaling 曲线,并展示新的视觉塔 MoonViT-V2:相比 SigLIP 初始化的 MoonViT-3D,它的梯度 norm 更低、尖峰更少,训练更稳定。
- 线程的结论是:在大规模多模态模型里,contrastive pretraining 可能并不是必要的初始化方式。
所属事件:Kimi K3 技术报告深度解读:架构与训练系统全面曝光(18 条相关)→
「模型」频道最新
- Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2 — elonmusk · 2026-07-29
- 一张爆图对比 12 类付费 AI 工具与免费替代品 — nikola_mr64990 · 2026-07-29
- Verdent 携手月之暗面,为 2.8T 参数 Kimi K3 优化编程工作流 — PrajwalTomar_ · 2026-07-29
- 120B 参数内最强本地模型求推荐:Qwen 系列仍是唯一解? — Possible_Grocery8079 · 2026-07-29
- OpenMed 发布开源医疗 AI 框架,结合 Kimi 本地处理临床数据 — MaziyarPanahi · 2026-07-29
- 教授实测 Flux 3:复杂提示词还原度极高 — emollick · 2026-07-29