Cursor开源MoK巨核加速混合专家模型训练实现最高2.37倍吞吐提升

1 阅读4分钟开源
Cursor开源MoK巨核加速混合专家模型训练实现最高2.37倍吞吐提升

背景与意义

Cursor Research 在其 Composer 系列模型背后研发的 MoE 训练框架取得显著突破,现将核心实现 Mixture‑of‑Kittens(MoK) 以 Apache‑2.0 开源。MoK 将所有 MoE 的通信与计算合并为单一确定性巨核,专为 NVIDIA Blackwell SM100/SM103 GPU 的 GB300 NVL72 机架设计,填补了大规模专家模型训练的通信瓶颈。

技术亮点

  • 单核决定论:传统方案将通信与计算拆分,导致跨 GPU 信号频繁。MoK 采用 pull‑dispatch + push‑combine 策略,将调度延迟从 103 µs 降至 18 µs,提升约 5.8 倍。
  • 环形令牌缓冲:使用固定容量环形缓冲区在 minibatch 维度循环,彻底摆脱 CPU 参与的调度路径,实现零令牌丢失。
  • 中等粒度重叠:在专家 GEMM 前后保留至少两波 SM 执行,使计算与通信实现细粒度交叉,兼顾 Comet 的细致和 DeepEP 的粗糙。
  • 多精度支持:原生兼容 BF16 与 MXFP8,两者在前向/后向均可获得 1.58‑2.37 倍的加速。

性能基准

在单个 NVL72 机架(64 GPU)上,MoK 对标最强公开基线(DeepEP+TransformerEngine),取得以下提升:

  • MXFP8 前向最高 2.37×,后向 1.78×
  • BF16 前向 1.92×,后向 1.58×

端到端 512 GPU(跨多机架)实测,单卡每秒 token 由 760.9 提升至 1,070.2,整体吞吐提升 1.41×。这些数据覆盖 Kimi 2.5、GLM‑5.2、Qwen3.5‑397B‑A17B 与 DeepSeek‑V4‑Pro 等主流 MoE 模型规模。

部署要求

  • 硬件:仅支持 Blackwell SM100 或 SM103 GPU,等同于 GB200/GB300 NVL72 机架;单机或 8‑GPU 环境无法使用。
  • 软件栈:Python 3.12+、PyTorch 2.10+、CUDA 13.0+,并依赖 PyTorch 对称内存实现的跨 GPU 缓冲。
  • 适用场景:大模型预训练、DeepSeek‑V3 类 MoE 结构、以及需要确定性回放的 on‑policy RL 后训练与内部消融实验。

行业影响

MoK 的开源降低了业界在 NVL72 规模机房内部署高效 MoE 训练的技术门槛,尤其对拥有自建 GPU 超算或租用大规模 NVLink‑dense 机架的模型实验室、国家计算中心以及新兴 GPU 云服务商具有直接价值。与此同时,确定性执行为科研 reproducibility 提供了可靠保障,可能促使更多学术工作在公开基准上复现 MoE 训练效果。

“MoK 将通信成本压至极限,真正让专家模型在算力密集型机架上释放潜能。”——Cursor 研发团队

获取方式

MoK 已同步至 GitHub(Apache‑2.0),仓库中提供完整编译指南、性能测试脚本以及与 Composer 系列模型的集成示例。感兴趣的组织可直接下载并在符合硬件条件的机房中进行评估。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。