1 万亿参数 MoE 仅靠 zero-RL 学出数学推理

i_dg23 · x · 2026-07-27

一篇新论文声称:一个 1 万亿参数 的 MoE 模型,在完全不看人工标注推理链的情况下,仅靠 zero-RL 就学出了数学推理能力。

训练设定

报告结果

配图还展示了基础设施优化点,例如混合精度控制、上下文并行优化,以及一些涌现行为:拟人化、结构化格式、并行推理和“上下文焦虑”。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →