1 万亿参数 MoE 仅靠 zero-RL 学出数学推理
i_dg23 · x · 2026-07-27
一篇新论文声称:一个 1 万亿参数 的 MoE 模型,在完全不看人工标注推理链的情况下,仅靠 zero-RL 就学出了数学推理能力。
训练设定
- 基座模型是 Ling-2.5-1T-Base,总参数 1T,但每个 token 实际只激活约 630 亿 参数。
- 训练采用 四阶段流水线:
- 第一阶段 RL:放大低概率推理 token,先把“思考苗头”激活出来。
- 自蒸馏:压缩冗长思维链,并修复 Megatron 训练与 SGLang 推理之间的数值偏差。
- 第二阶段 RL:继续稳定提升。
- 第三阶段 RL:引入自适应深度,简单题大约 4000 token,难题可拉到 64000 token。
- 训练使用了 320 张 H200。
报告结果
- 仅在第一阶段 RL 后,模型就在 AIME 2026 上达到 84.2% 正确率。
- 最终模型在 CoT 质量的 pairwise 比较中,分别以 78% 胜过 MiniMax-M2.7、以 76% 胜过 GLM-5.1。
- 解题 token 数也更省:6368,而 GLM-5.1 为 17220、Kimi-K2.6 为 14115。
- 用于蒸馏的数据只有 10 万条,远少于 DeepSeek-R1 的 80 万条。
配图还展示了基础设施优化点,例如混合精度控制、上下文并行优化,以及一些涌现行为:拟人化、结构化格式、并行推理和“上下文焦虑”。
「研究」频道最新
- AI slop 已开始污染代码评审和科研署名体系 — rbhar90 · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27