Kimi K3 据称已在 80 张 RTX 5090 上零 HBM 运行
markjeffrey · x · 2026-07-28
Kimi K3 被曝可在 80 张 RTX 5090 上运行
被引用的帖子称,完整的 Kimi K3 模型——据说有 2.8 万亿参数——已经能跑在 80 张 RTX 5090 上,单流吞吐约 20 tok/s,而且还是 day one、未调优 的状态。
关键点
帖子强调这是一种“首个开源权重前沿模型”的部署方式:
- 不使用 HBM
- 只靠 GDDR7 游戏卡
- 通过普通以太网连接
- 使用官方 MXFP4 权重,且 没有重新量化
这背后的含义是,最强级别的开源模型可能开始脱离昂贵 HBM 方案,转而用更常见的消费级 GPU 进行托管、微调和 agent 运行。
所属事件:Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(8 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23