1 万亿参数 MoE 仅靠 zero-RL 学出数学推理
i_dg23 · x · 2026-07-27
一篇新论文声称:一个 1 万亿参数 的 MoE 模型,在完全不看人工标注推理链的情况下,仅靠 zero-RL 就学出了数学推理能力。
训练设定
- 基座模型是 Ling-2.5-1T-Base,总参数 1T,但每个 token 实际只激活约 630 亿 参数。
- 训练采用 四阶段流水线:
- 第一阶段 RL:放大低概率推理 token,先把“思考苗头”激活出来。
- 自蒸馏:压缩冗长思维链,并修复 Megatron 训练与 SGLang 推理之间的数值偏差。
- 第二阶段 RL:继续稳定提升。
- 第三阶段 RL:引入自适应深度,简单题大约 4000 token,难题可拉到 64000 token。
- 训练使用了 320 张 H200。
报告结果
- 仅在第一阶段 RL 后,模型就在 AIME 2026 上达到 84.2% 正确率。
- 最终模型在 CoT 质量的 pairwise 比较中,分别以 78% 胜过 MiniMax-M2.7、以 76% 胜过 GLM-5.1。
- 解题 token 数也更省:6368,而 GLM-5.1 为 17220、Kimi-K2.6 为 14115。
- 用于蒸馏的数据只有 10 万条,远少于 DeepSeek-R1 的 80 万条。
配图还展示了基础设施优化点,例如混合精度控制、上下文并行优化,以及一些涌现行为:拟人化、结构化格式、并行推理和“上下文焦虑”。
「研究」频道最新
- EPFL 量子 CNN 仅用 10 个样本学会识别数字,同级经典 CNN 仍是随机水平 — PlisSergey · 2026-09-23
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23
- 剑桥出版高维统计新教科书,Samworth 与 Shah 合著免费开放 — FrnkNlsn · 2026-09-23
- Reinforce-Ada:按难度自适应分配算力,RLVR 收敛加速至 2 倍 — burny_tech · 2026-09-23
- 论文:Transformer 并非没有世界模型,而是特征叠加互相干扰 — burny_tech · 2026-09-23
- 新论文称 Transformer 难以学会 loop-closure 世界建模 — burny_tech · 2026-09-23