8 张 B300 跑 Kimi K3:每百万 token 成本 190 美元,附完整部署账单
OtherRaisin3426 · reddit · 2026-08-23
发帖者实测在 Modal 上用 8 张 B300($56.79/小时)部署 2.8T 参数的 Kimi K3,vLLM + 8 路张量并行 + 原生 MXFP4:
- 冷启动约 27 分钟(需加载 1.56 TB、JIT、51 次 CUDA graph 捕获)
- TTFT 0.92–1.02 秒,解码稳定 92 tok/s,4 个 prompt 平均 83 tok/s
- 折合约 $190/百万输出 token;一次完整跑约 $36 GPU 时间;保持热机一天要 $1,363
对比 Unsloth 的 1-bit Dynamic GGUF(594 GB,可用 llama.cpp 塞进 8×A100-80GB,$19.99/小时,便宜 2.8 倍):只有约 9 tok/s、TTFT 7–60 秒,折合约 $620/百万 token,单 token 反而贵 3.3 倍。1-bit 量化下质量尚可(算术正确、行文连贯)。完整配置、Modal 部署文件与原始 benchmark JSON 见其博客。
「Infra」频道最新
- Unswarm:自托管 LLM 运行时管理器,支持多模型队列与代理 — Atretador · 2026-08-23
- Mistral 被曝 2030 年前在欧洲布局至多 1GW 算力 — emmanuelvivier · 2026-08-23
- AI 与 RAG 必读:新闻搜索 API 深度横向对比 — ermanos12 · 2026-08-23
- Unsloth 版 Qwen3.8-27B 移植 MTP 模式,显存占用更低 — Nyghtbynger · 2026-08-23
- 因 DRAM 短缺,英伟达 AI 服务器价格 reportedly 上涨 15% — The Decoder · 2026-08-23
- ComfyUI 节点优化:稀疏注意力提速 5-20% — Zironic · 2026-08-23