Kimi代码模型推理超千tok/s
JiaZhihao · x · 2026-07-10
Lithos 分享了他们为 Kimi K2.7 Code 构建的 serving stack:在单个 8×B200 节点上,面向编码负载可达到每用户超过 1000 tokens/s 的峰值吞吐,同时保持模型原生精度、完整质量且不引入额外近似。
他们强调,对智能体来说,速度会直接影响每一步推理、编码与迭代的延迟;因此“超快推理”会改变 agentic 体验。帖子附带了试用链接。
「编程与Agent」频道最新
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11