NVIDIA发布Molt框架:8.6K行代码实现PyTorch原生代理强化学习
•0 阅读•3分钟•前沿
NVIDIAvLLM强化学习RayMolt
•0 阅读•3分钟•前沿
背景与动机
在代理强化学习(Agentic RL)领域,算法迭代频繁,研究者往往需要在训练器、分布式后端和 rollout 代码之间来回切换。传统框架的层层封装导致每一次新算法的实现都要修改大量底层代码,极大增加了研发成本。NVIDIA 的 NeMo 团队基于此痛点,打造了 Molt,旨在提供一个轻量、可读、且易于扩展的研究基础设施。
核心设计与实现
- 代码规模:约 8.6K 行 RL 代码(通过 import graph 统计),相比 verl(62K 行)和 slime(25K 行)更为紧凑。
- 模块组合:
- Ray 负责节点调度与异步队列;
- vLLM 提供高效的模型 rollout 引擎;
- NVIDIA AutoModel(基于 FSDP2)完成大模型训练。三者均未 fork,升级只需更换容器镜像。
- 统一循环:整个系统围绕单一异步循环构建,训练 actor 与多个 vLLM 引擎共享同一 token‑exact 流程,确保“采样即训练”不产生 token 漏失。
- 两种交互方式:
- Env:框架自行管理 Gymnasium‑compatible 步骤;
- ChatAgent:用户通过 OpenAI 或 Anthropic SDK 自主控制循环。
部署与性能
Molt 以 Apache‑2.0 授权发布,提供完整的 launch 脚本、Slurm 配置及预构建容器。官方基准在 2 节点、每节点 8 张 H100 GPU(训练 8 张、rollout 8 张)下运行,吞吐统计上与 Megatron 系统持平,唯一差异是 MoE 模型的 expert 匹配开销需额外处理。框架支持从 4B 密集模型到 700B MoE 大模型的 FSDP 参数配置(--fsdp.ep_size 256),具备良好的可扩展性。
适用场景与生态兼容
- 多轮工具使用代理;
- 代码执行型智能体;
- 视觉‑语言环境(如 geo3k 示例);
- LLM‑as‑judge 奖励回路;
- On‑policy 蒸馏到轻量学生模型。
由于未对 Ray、vLLM、AutoModel 进行 fork,社区的任何上游改进都会自动通过容器镜像传递,降低维护成本。
业界意义
Molt 的出现标志着代理强化学习基础设施进入“可读‑可维护”阶段。研究者可以在保持代码可审视的前提下,快速迭代新算法;同时,企业实验室和高校实验室在拥有多节点 H100/H200 资源时,能够直接复用该堆栈进行高性能实验。随着生成式 AI 与强化学习的交叉融合加速,Molt 有望成为下一代多模态、长时序智能体研发的标准平台。
关键要点
- 约 8.6K 行代码,约为同类框架的 1/7;
- 组合 Ray、vLLM、AutoModel,保持上游升级无缝;
- 通过 token‑exact 循环实现训练‑推理一致性;
- 在 H100 集群上吞吐可比 Megatron,支持 4B‑700B 规模模型。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。