Kimi K3 被指服务成本比 V4 高出两倍以上
teortaxesTex · x · 2026-07-27
这条回复围绕 Kimi K3 的工程与部署成本展开,观点是:Kimi K3 的推理服务成本比 V4 高出两倍以上。
评论者同时提到,这类模型在落地时要解决大量工程难题,而技术报告里也没有披露训练 token 数量。整体信息指向的是:Kimi K3 可能是非常大的前沿模型,但它的部署经济性很重、服务成本不低。
「Infra」频道最新
- llama.cpp 在 PR 25994 中加入 Nanbeige4.2 支持 — pmttyji · 2026-07-27
- 开源 Kimi K3 speculator 让单流吞吐升至 370 tok/s — vllm_project · 2026-07-27
- vLLM 列出 Kimi K3 的解耦、KV offload 和 MoE 方案 — vllm_project · 2026-07-27
- Inferact 的 Kimi-K3-DSpark 复用 MLA 缓存加速 vLLM — vllm_project · 2026-07-27
- Kimi K3 用固定 KDA 状态替代增长式 KV 缓存 — vllm_project · 2026-07-27
- MoonshotAI 开源 MoonEP,做专家并行负载均衡 — teortaxesTex · 2026-07-27