Cursor 开源 MoK 内核,MoE 训练吞吐量提升 41%
rohanpaul_ai · x · 2026-08-06
AI 编程工具 Cursor 宣布开源其混合专家(MoE)训练超内核 Mixture-of-Kittens (MoK)。该内核专为 NVL72 机架设计,将所有 MoE 的通信与计算融合进一个完全确定性的内核中,相比最强公开基线运行速度提升达 2.37 倍。
优化背景与技术细节:
- 在大模型训练中,芯片间的 token 传输耗时严重,MoK 通过重写传输调度,在同等硬件上多完成了 41% 的工作量。
- 此前被替换的通信层曾是训练中最大的单点开销,在某些工作负载中消耗了一半以上的总步长时间。
- 早期优化仅针对算术部分(如自定义 MXFP8 内核加速专家计算),但当计算不再是瓶颈时,数据传输便成了拖慢整体进度的致命弱点。
- 迁移到 GB300 NVL72 机架虽然带来了 72 个芯片间的高速直连,但也引入了新的系统挑战。
所属事件:Cursor开源MoK内核,NVL72训练提速超2倍(8 条相关)→
「Infra」频道最新
- Nous Research 推出 Actual 本地推理栈,适配 Hermes 智能体 — NousResearch · 2026-08-06
- 买 128GB AI 笔记本还是等 RTX Spark?开发者纠结本地 LLM 硬件 — Dance-Till-Night1 · 2026-08-06
- 亚马逊预计 2026 年资本支出超 2200 亿,算力仍供不应求 — Beth_Kindig · 2026-08-06
- AI智能体具备黑客能力,特定基础设施托管面临高风险 — tszzl · 2026-08-06
- TokenSpeed 调度器架构解析:C++ 控制面与 Python 执行面解耦 — zhyncs42 · 2026-08-06
- 马斯克:AI 算力每半年增 10 倍,传统数据中心将向 AI 转型 — r0ck3t23 · 2026-08-06