Cursor开源MoE训练算子MoK,NVL72算力近乎翻倍
Cursor 宣布开源名为 Mixture-of-Kittens (MoK) 的混合专家模型(MoE)训练超级算子,专为 GB300 NVL72 架构设计。官方宣称该技术能将近乎翻倍 TFLOP/s 的性能表现,为 MoE 架构提供显著的算力红利,引发业界对大规模模型训练效率的关注。
已确认
- 核心优化机制:MoK 将所有 MoE 相关的通信和计算融合到一个完全确定性的单一内核中,支持跨 GPU 通信。
- 性能提升表现:官方及转发信息指出,该算子在 NVL72 架构前向传播中实现超过 2 倍的提速,整体算力近乎翻倍。
- 适用场景定位:这是一个生产级算子,旨在解决和优化万卡级别大规模模型训练中的瓶颈融合问题。
为什么重要
随着大模型参数与规模指数级增长,MoE 架构的跨设备通信与计算瓶颈成为限制算力释放的关键。MoK 通过极致的内核融合方案,显著提升了 NVL72 系统的训练吞吐量,为降低超大模型训练成本和提升硬件利用率提供了重要的技术路径。
2026-08-05 ~ 2026-08-05 · 5 条相关
一手来源
- Cursor 发布 MoE 训练 megakernel,宣称算力近乎翻倍 — CapnHat ·
- Cursor开源MoE训练内核MoK,NVL72前向传播提速超2倍 — eliebakouch ·
- Cursor 开源 MoK:专为 NVL72 打造的 MoE 训练 Megakernel — StasBekman ·
- 【源头】Cursor开源MoE训练内核MoK,NVL72前向传播提速超2倍 — eliebakouch · 2026-08-05
- HazyResearch 开源 MoK:专为 NVL72 打造的 MoE 融合算子 — HazyResearch · 2026-08-05
- 【源头】Cursor 发布 MoE 训练 megakernel,宣称算力近乎翻倍 — CapnHat · 2026-08-05
另有 2 条近重复转述:StasBekman · nicolascraske