Kimi K3 以 2.8T MoE、104B 激活参数和百万上下文亮相
stochasticchasm · x · 2026-07-28
这条帖子在评论 Kimi K3 技术报告时指出:K3 和 MoonVIT 2 的训练 token 数、计算量都没有在报告里披露,这是一个值得注意的选择。
配图中的摘要补充了模型本身的关键信息:Kimi K3 是一个 2.8T 参数的 MoE 模型,有 104B 激活参数、原生视觉能力,上下文窗口达到 100 万 token。论文声称它相比 Kimi K2 的整体 scaling efficiency 约提升 2.5×,改进来自 KDA、Stable LatentMoE、训练/数据配方优化,以及面向长程执行的后训练。
评测上,K3 在长上下文编程、agent、知识、推理和视觉任务上达到前沿水平;虽然总体上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在作者的评测集合里已经稳定超过其他开源和部分闭源模型。论文还宣布 开放完整权重,以便后续研究和部署。
「模型」频道最新
- Claude Opus 5 维持 4.8 版定价,编码表现逼近 Fable 5 — AlexKim · 2026-07-28
- Claude Opus 5 迁移指南悄悄改写了多年提示词建议 — AlexKim · 2026-07-28
- 帖子称一款注意力骨干模型有 104B 激活参数 — zephyr_z9 · 2026-07-28
- MiMo V2.5 Pro 在世界杯预测中胜过 DeepSeek V4 Pro — PreciousSeige · 2026-07-28
- Kimi K3 在 Modal 跑到 460 tok/s,5.6 Sol 迎来发布周压力 — brandon_galang · 2026-07-28
- Kimi K3 架构因 KDA、AttnRes 和 gated MLA 获好评 — stochasticchasm · 2026-07-28