Kimi K3 视觉路径用 MoonViT-V2 和 4 倍降 token
stochasticchasm · x · 2026-07-28
- 配图里的论文段落说明了 Kimi K3 的视觉路径:先用 MoonViT-V2 编码,再通过轻量 MLP projector 接入 LLM。
- MoonViT-V2 被描述为一个 27 层、约 0.4B 参数 的视觉 Transformer,采用 RMSNorm,并移除线性层和注意力投影中的 bias,以稳定从零训练。
- 图像和视频使用共享参数,注意力拆成帧内空间与帧间时间两条路径,时间池化还会进一步压缩 token。
- 最关键的是,投影前做 2×2 pixel-shuffle 下采样,把视觉 token 数量减少 4 倍,从而让最高 3584×3584 像素的输入也能塞进 1M token 上下文。
所属事件:月之暗面发布 Kimi K3 技术报告,宣称训练效率提升 2.5 倍(33 条相关)→
「研究」频道最新
- CMU 的 O-VAD 通过物体状态追踪做工业异常检测 — CarnegieMellonU · 2026-07-28
- Kimi K3 技术报告显示缩放效率较 Kimi K2 提升 2.5 倍 — stochasticchasm · 2026-07-28
- Latent Action Model 讲座将演示如何仅靠观察学会超级马里奥 — ceciletamura · 2026-07-28
- GLM 5 之后引入 per-head Muon 平衡各头更新 — stochasticchasm · 2026-07-28
- MLA 机制每百万 token 需 12GB KV,KDA 状态约 230MB — zephyr_z9 · 2026-07-28
- OpenAI 图表称 43.5% 的职业特定用法跨出本职 — soumitrashukla9 · 2026-07-28