Moonshot K3 部署与长文本推理成本引发热议
近期关于 Moonshot K3 模型的算力部署与推理成本引发了社区热议。有观点指出,K3 可能采用了 multi-node H200 进行服务部署,其吞吐表现或不及 nvfp4 b300。此外,在处理超过 10 万 token 的长文本时,K3 的服务成本可能显著高于 V4 模型。具体成本差异程度取决于多种实际运行因素,引发了开发者对大模型落地经济效益的关注。
2026-07-19 ~ 2026-07-21 · 2 条相关
- Moonshot被指用H200部署k3 — TheZachMueller · 2026-07-19
- Moonshot K3 在 10 万 token 以上的服务成本可能显著高于 V4 — teortaxesTex · 2026-07-21