Cohere 用单个 CUDA megakernel 服务 30B 模型,batch 1 达 292 tokens/秒
dl_weekly · x · 2026-09-17
Cohere 发布深度工程长文,介绍其 North Mini Code Megakernel 推理引擎:用一个持久的 CUDA「megakernel」服务 30B 模型,batch size 为 1 时达到 292 tokens/sec,相当于理论峰值的 62%,而 vLLM 在同条件下仅发挥约 39%。
核心做法是把解码全流程融合进一个常驻 GPU 的 mega kernel,减少 kernel 启动与显存往返开销——对单请求低延迟场景(如编码助手)收益尤其大。对做推理优化的人是难得的一手工程复盘。
「Infra」频道最新
- 黄仁勋:英伟达明年芯片销量将比今年翻一倍 — zephyr_z9 · 2026-09-17
- GlobalFoundries 与 Marvell 扩建佛蒙特厂,增产 AI 光互连芯片 — zephyr_z9 · 2026-09-17
- 26100 美元的桌面 AI 数据中心:双 RTX PRO 6000 开源工作站 — dee_hw · 2026-09-17
- 爆料称华为拟扩 4096 卡超节点,单节点 HBM 可达 384TB — zephyr_z9 · 2026-09-17
- Brad Gerstner:43GW 算力预测太激进,实际约 25GW 一半归 OpenAI/Anthropic — firstadopter · 2026-09-17
- Ousterhout:AI 集群对 TCP 的告别时刻到了 — AI Engineer · 2026-09-17