Kimi K3 据称跑在 80 张 RTX 5090 上,合计 2.56TB 显存
sandyyevans · reddit · 2026-07-28
宁团队据称把 Kimi K3 部署在 80 张 RTX 5090 上做本地推理,整体为 10 台节点、每台 8 卡,合计 2.56TB 显存。
- 目前用的是 FP4 权重。
- 方案里没有 HBM、NVLink、InfiniBand,主要靠 5090 的 GDDR7 和 25GbE 网络。
- 单路推理速度约 20 tok/s,团队也承认还没怎么优化。
原帖认为这套配置带有一定“宣传秀”色彩,但也说明一个趋势:随着 GPU 性能继续演进,过去看起来离谱的本地大模型部署,可能在一两年内变得相当现实。
所属事件:Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(8 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23