Cohere 开源 Megakernel 推理引擎:单卡 H100 上比 vLLM 快 1.58 倍
cohere · x · 2026-09-09
- Cohere 发布其 North Mini Code Megakernel 推理引擎并附博客详解。
- 公布的成绩:North Mini Code 在单张 H100(BF16)上 BS=1 时达到 vLLM 的 1.58 倍,BS=8 时端到端服务吞吐为 vLLM 的 1.25–1.41 倍。
- 博客解释了 megakernel 的概念及系统构建方式,是推理栈层面的优化工作,面向 agentic 编码模型的自主部署场景。
所属事件:Cohere 开源 Megakernel 推理引擎,快过 vLLM 1.58 倍(2 条相关)→
「Infra」频道最新
- vLLM 硬核复盘:管线并行遇热缓存失效,Kimi K3 解码吞吐 2.7 倍 — vllm_project · 2026-09-09
- vLLM 实测:Agent 会话中位 43 轮,输入 142K 输出仅 444 token — vllm_project · 2026-09-09
- vLLM 发布 AgentX 基准实测,全栈优化真实 Agent 推理服务 — vllm_project · 2026-09-09
- 谷歌云 CEO:自研芯片服务器回本周期不到 1 年,约为 GPU 一半 — matt_slotnick · 2026-09-09
- DeepSeek 限时放出 v4.1 Flash:1 美元可烧 5800 万 token — MicahBerkley · 2026-09-09
- 为 ComfyUI 长视频序列新增 top_level_requeue 模式,根治内存持续增长 — Slight-Living-8098 · 2026-09-09