Kimi K3 结合 2.8T MoE、100 万上下文和多教师后训练
novasarc01 · x · 2026-07-28
Kimi K3 是一款 2.8T MoE 模型,带原生视觉和 100 万 token 上下文
这条帖在概括 Kimi K3 技术报告,信息量主要集中在规模、训练配方和后训练策略上。
- Kimi K3 被描述为一个 2.8T 参数的 MoE 模型,有 104B 激活参数、原生视觉能力,以及 100 万 token 上下文窗口。
- 报告称它通过 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE 提升了扩展效率,整体大约比 Kimi K2 高 2.5×。
- 后训练阶段覆盖 general / agentic / coding 三类教师模型,并按多档推理力度进行训练。
- 最终通过 Multi-Teacher On-Policy Distillation(MOPD) 把不同专长统一到一个可部署的模型里。
- 评测上,报告声称它在长程编码、智能体任务、知识、推理和视觉任务上达到前沿水平,但总体仍落后于 Claude 4.5 和 GPT-5.6 Sol。
所属事件:Kimi K3 技术报告解读:万亿参数与后训练创新(2 条相关)→
「编程与Agent」频道最新
- Claude Opus 5 在编码中反复用 Python 脚本改文件 — samuelcolvin · 2026-07-28
- Vercel 展示开源技术栈,Eve 和 agent-browser 在列 — evilrabbit_ · 2026-07-28
- LightOn 搜索在 agent 基准上 86.27% 准确率只用 9.7 次调用 — IgorCarron · 2026-07-28
- AI 时代的等待方程:修 Bug 还是等下一代模型 — ilanbigio · 2026-07-28
- 资源变化后,agent 的人工批准还应继续有效吗 — marcelk231 · 2026-07-28
- Webhound 用 $5 找出一笔未披露的 1800 万美元变更 — ycombinator · 2026-07-28