Kimi K3 开源权重 2.8 万亿,单机根本跑不动
ArtificialAnlys · x · 2026-07-29
本地跑 Kimi K3 需要数据中心级硬件
Artificial Analysis 认为,Kimi K3 比近期开源权重旗舰如 GLM-5.2 难部署得多,甚至是首个在单个 Hopper 节点上连 4-bit 量化都放不下的开源权重模型。
关键信息
- 总参数 2.8 万亿,是目前最大的开源权重模型。
- 按原生 MXFP4 计算,光权重就要占用约 1560 GB 显存,还没开始服务 token。
- 其混合注意力机制降低了 KV cache 压力;在 GB300 NVL72 上,若只看容量不看吞吐,256K 上下文理论上可支持 2000+ 并发请求,而 Kimi K2.6 约为 1000。
- 但即便只给单用户跑 256K 上下文,仍需约 1570 GB 内存;若使用 16-bit KV cache,每增加一个并发用户还要再加约 8 GB。
- 综合看,整套系统成本会到几十万美元量级,具体取决于硬件配置和采购价格。
可行硬件配置
文章给出的可行方案包括:8× B300 / GB300、16× B200 / GB200,以及 AMD 的 8× MI355X / MI455X。
Artificial Analysis 还表示会很快发布首日推理基准,并持续跟踪推理栈成熟后性能的变化。
所属事件:Kimi K3 开源 2.8 万亿参数推高算力门槛(3 条相关)→
「Infra」频道最新
- YouTube 式语义 ID 用双用途 token 缓解推荐系统内存墙 — _reachsumit · 2026-07-29
- Meta 的 Memory Layer 让 Reels 覆盖率到 100% 新鲜度到 20 秒 — _reachsumit · 2026-07-29
- VaLiDRec 用可变长度语义 ID 做推荐 推理比 LC-Rec 快 87.49 倍 — _reachsumit · 2026-07-29
- 印度 AI 推理市场将奖励模型与硬件协同优化的公司 — santoshpanda · 2026-07-29
- Anthropic 推出 MCP 最大升级:转向无状态,月下载破 4 亿 — 新智元 · 2026-07-29
- Hermes Agent 桌面版靠并行工具和远程本地模型圈粉 — Teknium · 2026-07-29