Kimi K3 技术细节曝光:3T 参数 MoE 架构,未披露训练算力
stochasticchasm · x · 2026-07-28
有开发者对月之暗面最新开源的 Kimi K3 模型架构进行了分析。该模型总参数量达到 3T,采用了比前代更稀疏的 MoE 架构(16/896),而 K2 的配置为 8/384。
作者认为目前的稀疏度表现已经相当不错,但理论上还有进一步优化的空间,并推测制约更稀疏架构的瓶颈可能在于 VRAM。此外,作者特别指出,Kimi K3 以及 Moonvit 2 的技术报告中均未披露训练所用的 token 数量和算力规模,这一信息隐藏策略引起了社区的注意。
所属事件:Kimi K3 架构细节:3T参数与极稀疏MoE配置(2 条相关)→
「模型」频道最新
- 微软再次强调 MAI-Cyber-1-Flash 安全栈 — satyanadella · 2026-07-28
- 微软发布 MAI-Cyber-1-Flash,称 CyberGym 成绩领先且成本减半 — satyanadella · 2026-07-28
- Claude Opus 5 维持 4.8 版定价,编码表现逼近 Fable 5 — AlexKim · 2026-07-28
- Claude Opus 5 迁移指南悄悄改写了多年提示词建议 — AlexKim · 2026-07-28
- 帖子称一款注意力骨干模型有 104B 激活参数 — zephyr_z9 · 2026-07-28
- MiMo V2.5 Pro 在世界杯预测中胜过 DeepSeek V4 Pro — PreciousSeige · 2026-07-28