Molt:纯PyTorch智能体RL框架
青稞AI · wechat · 2026-07-16
Molt 是一个 agentic-first、纯 PyTorch Native 的强化学习框架,目标是把 agentic RL 做到“代码可读、可改、还能扩到大规模 MoE”。
核心设计
- 核心 RL 代码约 9,000 行,整体运行时只依赖 Ray + vLLM + NVIDIA AutoModel/FSDP2,不依赖 Megatron。
- 把 智能体视为 Python 程序:agent、奖励函数、工具调用、LLM-as-judge、VLM 环境都可直接接入。
- 训练链路是异步的:Rollout 由 vLLM 负责,训练由 PyTorch/FSDP2 负责,Ray 负责编排与队列。
关键工程能力
- 支持多轮工具调用、LLM-as-judge、多模态 VLM、SFT 和多种 RL 算法(REINFORCE、RLOO、GRPO、PPO 等)。
- 强调 训推一致性:用 vllmkl 和重要性采样做偏差校正,处理异步 rollout 带来的 logprob 失配。
- 为 MoE 场景提供 RouterReplay 和 RouterFreeze,避免训练和推理时专家路由不一致。
- 支持全异步 rollout、partial rollout、CPU offload,以及 TP/EP/CP 等并行方式。
规模与定位
- 官方声称已验证从 Qwen3.5-397B 到 GLM-5.2753B 级别的 MoE 训练。
- 作者将它和 verl / slime / OpenRLHF 对比,强调差异在于:更轻量、纯 PyTorch、仍能扛大模型。
文末还给了命令行上手示例和仓库/技术报告链接,适合想做 agentic RL 或大规模后训练的人直接参考。
所属事件:NVIDIA推出纯PyTorch强化学习框架Molt(3 条相关)→
「编程与Agent」频道最新
- 别让 AI 自造成功标准:给它可验证目标才好用 — daniel_mac8 · 2026-09-11
- Sakana AI 发布 Fugu Max:动态编排开源模型池逼近精英模型性能 — graceisford · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11