Kimi代码模型推理超千tok/s

JiaZhihao · x · 2026-07-10

Lithos 分享了他们为 Kimi K2.7 Code 构建的 serving stack:在单个 8×B200 节点上,面向编码负载可达到每用户超过 1000 tokens/s 的峰值吞吐,同时保持模型原生精度、完整质量且不引入额外近似。

他们强调,对智能体来说,速度会直接影响每一步推理、编码与迭代的延迟;因此“超快推理”会改变 agentic 体验。帖子附带了试用链接。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →