Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行
开源模型Kimi K3(2.8万亿参数)据称已成功部署在由80张RTX 5090组成的消费级GPU集群上,单流吞吐量约20 tok/s,完全无需HBM显存。该方案使用官方FP4(MXFP4)权重,未重新量化,是首个在纯消费级硬件上运行的前沿大模型案例,打破了高端AI推理对数据中心级专用硬件的依赖。
已确认
- 硬件配置:集群共80张RTX 5090,分为10个节点,每节点8卡,合计2.56TB显存。
- 网络与带宽:节点间使用25GbE以太网连接,未采用InfiniBand。
- 模型与性能:Kimi K3拥有2.8万亿参数,使用官方FP4权重,单流吞吐约20 tok/s。
- 自建替代方案:作者@Liueroteme提出EPYC 9556 CPU + 16x 256GB DDR5(共4TB内存)方案,总成本约5万美元;若配备12800MT/s MRDIMM,带宽可达1.6TB/s,推理性能有望达25 TPS。
尚未确认
- 帖子提及Kimi K3与GLM-5.2据称将很快开放“Mining”(挖矿)模式,目前尚属传闻。
为什么重要
- 这是首个在纯消费级硬件上成功运行的前沿开源大模型案例,打破了高端AI推理对数据中心级专用硬件的绝对依赖,为低成本部署超大参数模型提供了新思路。
- 随着顶级开源模型权重稳定在3T左右,5万美元级别的自建服务器有望成为普通家庭可负担的选择。作者@Liueroteme将其比作家庭购买第二辆车的开销,预示着顶级AI算力未来可能向家庭场景普及。
2026-07-28 ~ 2026-07-29 · 8 条相关
- 第 1 集:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(2026-07-27,11 条)
- 第 2 集:Fireworks 平台上线 Kimi K3 推理与多维微调功能(2026-07-28,2 条)
- 第 3 集:Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(2026-07-28,8 条)
- 第 4 集:Kimi K3 开放权重发布,引爆开源与基础设施讨论(2026-07-28,5 条)
- 第 5 集:算力账本:Kimi K3 自托管百天内回本(2026-07-28,4 条)
- 第 6 集:极客尝试在 Mac 设备本地量化运行 K3 大模型(2026-07-29,2 条)
- 第 7 集:Kimi K3 开源 2.8 万亿参数推高算力门槛(2026-07-29,3 条)
- 第 8 集:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2026-07-29,2 条)
- 第 9 集:Kimi K3开源首日获vLLM及AMD等多平台支持(2026-07-30,14 条)
一手来源
- Kimi K3 据称已在 80 张 RTX 5090 上零 HBM 运行 — markjeffrey ·
- Kimi K3 据称跑在 80 张 RTX 5090 上,合计 2.56TB 显存 — sandyyevans ·
- K3 模型自托管方案:50 万美元配置实现 25 tps 推理性能 — Liu_eroteme ·
- 【源头】Kimi K3 据称已在 80 张 RTX 5090 上零 HBM 运行 — markjeffrey · 2026-07-28
- Kimi K3 2.8T参数开源模型在80张RTX 5090上跑出20 tok/s,零HBM需求 — markjeffrey · 2026-07-28
- Kimi K3 被实测跑在 80 张 RTX 5090 上 — panchovix · 2026-07-28
- Kimi K3 与 GLM-5.2 据称将开放挖矿,80 张 5090 跑通 — const_reborn · 2026-07-28
- 【源头】Kimi K3 据称跑在 80 张 RTX 5090 上,合计 2.56TB 显存 — sandyyevans · 2026-07-28
- 【源头】K3 模型自托管方案:50 万美元配置实现 25 tps 推理性能 — Liu_eroteme · 2026-07-29
- 未来家庭选择:买第二辆车还是在地下室放一台 K3 模型服务器? — Liu_eroteme · 2026-07-29
- 5 万美元 EPYC 自建 K3,瞄准 1.6TB/s 带宽与 25 TPS — Liu_eroteme · 2026-07-29