Kimi K3 以 2.8T MoE、104B 激活参数和百万上下文亮相

stochasticchasm · x · 2026-07-28

这条帖子在评论 Kimi K3 技术报告时指出:K3 和 MoonVIT 2 的训练 token 数、计算量都没有在报告里披露,这是一个值得注意的选择。

配图中的摘要补充了模型本身的关键信息:Kimi K3 是一个 2.8T 参数的 MoE 模型,有 104B 激活参数、原生视觉能力,上下文窗口达到 100 万 token。论文声称它相比 Kimi K2 的整体 scaling efficiency 约提升 2.5×,改进来自 KDA、Stable LatentMoE、训练/数据配方优化,以及面向长程执行的后训练。

评测上,K3 在长上下文编程、agent、知识、推理和视觉任务上达到前沿水平;虽然总体上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在作者的评测集合里已经稳定超过其他开源和部分闭源模型。论文还宣布 开放完整权重,以便后续研究和部署。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →