Kimi K3 以 2.8T MoE、104B 激活参数和百万上下文亮相
stochasticchasm · x · 2026-07-28
这条帖子在评论 Kimi K3 技术报告时指出:K3 和 MoonVIT 2 的训练 token 数、计算量都没有在报告里披露,这是一个值得注意的选择。
配图中的摘要补充了模型本身的关键信息:Kimi K3 是一个 2.8T 参数的 MoE 模型,有 104B 激活参数、原生视觉能力,上下文窗口达到 100 万 token。论文声称它相比 Kimi K2 的整体 scaling efficiency 约提升 2.5×,改进来自 KDA、Stable LatentMoE、训练/数据配方优化,以及面向长程执行的后训练。
评测上,K3 在长上下文编程、agent、知识、推理和视觉任务上达到前沿水平;虽然总体上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在作者的评测集合里已经稳定超过其他开源和部分闭源模型。论文还宣布 开放完整权重,以便后续研究和部署。
所属事件:Moonshot 发布 Kimi K3 开放权重引争议(155 条相关)→
「模型」频道最新
- 博主实测称 Anthropic Opus 5.5 对话体验出色 — daniel_mac8 · 2026-09-23
- Opus 5.5 与 GPT-6 Sol/Luna 一夜齐发,OpenAI 价格砍半抢市场 — AlchainHust · 2026-09-23
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23
- 研究者观察:爱晒AI吹捧自己的多是反社会行为者 — repligate · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23