Kimi K3 的 1.4TB 权重,只有 8 张 B300 真放得下
qubridInc · reddit · 2026-07-27
Moonshot 的 Kimi K3 权重今天下发,有团队已经先把显存账算起来了。
帖子里列出的关键信息包括:
- 总参数约 2.8T
- 896 个专家,每个 token 激活 16 个
- 100 万上下文,支持视觉
- 量化后权重下载量大约 1.4 TB
接着作者对三套 GPU 配置做了部署可行性分析:
- 8× A100 80GB:总共只有 640 GB,连权重都塞不下,更别说 KV cache;如果真跑,只能走 dequantization 或非常非目标的 INT4 kernel。
- 8× H200:约 1.13 TB,仍然不够单节点装下。
- 8× B300:约 2.3 TB,这是唯一能把整模型放进单节点、还能留出长上下文缓存的方案。
帖子还转述了模型卡的几个“坦诚弱点”:如果 agent harness 截断思考历史,效果会下降;在歧义场景里,它倾向于直接行动而不是追问;即便基准接近,聊天体验也仍被认为落后于 Fable 5 和 Sol。作者计划在三种 GPU 配置上给出吞吐、首 token 时延和每百万 token 成本的数据。
所属事件:Moonshot 发布 Kimi K3 开放权重引争议(155 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11