Cohere 用单个 CUDA megakernel 服务 30B 模型,batch 1 达 292 tokens/秒

dl_weekly · x · 2026-09-17

Cohere 发布深度工程长文,介绍其 North Mini Code Megakernel 推理引擎:用一个持久的 CUDA「megakernel」服务 30B 模型,batch size 为 1 时达到 292 tokens/sec,相当于理论峰值的 62%,而 vLLM 在同条件下仅发挥约 39%。

核心做法是把解码全流程融合进一个常驻 GPU 的 mega kernel,减少 kernel 启动与显存往返开销——对单请求低延迟场景(如编码助手)收益尤其大。对做推理优化的人是难得的一手工程复盘。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →