Cohere 开源解码 megakernel 推理引擎,比 vLLM 快最高 1.58 倍
cohere · x · 2026-09-09
Cohere 发布了首个围绕 decode megakernel 构建的完整 LLM 推理服务系统,完全开源。
- 核心思路:megakernel 将整个 LLM decode 前向计算融合为单个持久化 CUDA kernel 启动,消除逐算子的 launch 开销与算子间全网格同步,最大化 GPU 利用率
- 性能:单张 H100(BF16)上 BS=1 解码较 vLLM 快 1.58 倍,BS=8 端到端服务达 1.25–1.41 倍,达到 H100 speed-of-light 的 62%
- 定位:早期研究版本,提供 OpenAI 兼容 API,目前仅支持单卡 H100(sm90a)、CUDA 13+、batch ≤8,为 North Mini Code 构建
所属事件:Cohere 开源 Megakernel 推理引擎,快过 vLLM 1.58 倍(2 条相关)→
「Infra」频道最新
- 谷歌云 CEO:自研芯片服务器回本周期不到 1 年,约为 GPU 一半 — matt_slotnick · 2026-09-09
- DeepSeek 限时放出 v4.1 Flash:1 美元可烧 5800 万 token — MicahBerkley · 2026-09-09
- 为 ComfyUI 长视频序列新增 top_level_requeue 模式,根治内存持续增长 — Slight-Living-8098 · 2026-09-09
- 零用户副业项目访客前三:Amazon、Anthropic、OpenAI — zeeg · 2026-09-09
- Kimi K3(2.8T)被塞进 MacBook Pro:四块 SSD 流式读取跑出 1 token/s — Argonautlabs · 2026-09-09
- NVIDIA 发布 CUDA Python 1.0:Python 成 CUDA 一等公民 — PyTorch · 2026-09-09