Mistral 拆解大规模 RL 训练:3000 张 GPU 日产 330 亿 token
sophiamyang · x · 2026-10-06
Mistral 研究人员 Sophia Yang 分享其大规模强化学习训练系统的关键设计:
- Actor 集群自动扩缩容:并行数万条 rollout,异步训练;
- 为长轨迹而生:单条 rollout 可达数百万 token,支持多次 compaction,保持低 staleness;
- 两个阶段的新方法削减 off-policy 漂移,使长程 RL 训练稳定;
- 3000 张 GPU 每天产出约 330 亿 token,过滤+掩码后约 160 亿进入训练;
- 奖励曲线在代表性环境中随策略学会更难的任务而持续上升。
作者还在回复中称其在跨领域人工评测上「碾压 GLM 5.3」,该说法未附详细数据,未经证实。
「模型」频道最新
- dioscuri 晒出说服自己的论文:11 个 LLM 心智理论测试超越儿童 — dioscuri · 2026-10-06
- LMArena 上线 Mistral 战斗与 Agent 模式测试入口 — arena · 2026-10-06
- 传 GPT-6 自主一小时内攻破作者最爱的 CTF 挑战 — SIGKITTEN · 2026-10-06
- Mistral Large 4 每题耗 token 超 GPT-6 两倍,智能还不及对手 — haider1 · 2026-10-06
- Mistral 内部人士盛赞 Large 4:「模型终于够好了」 — qtnx_ · 2026-10-06
- Reflection AI 称 Beam 推理效率达 GLM 5.2 的 3-4 倍 — ChrSzegedy · 2026-10-06