万亿参数零RL的涌现现象

inclusionAI · hf · 2026-07-16

这是一篇把 zero RL 扩展到 1T 参数 的研究,重点不是单纯刷分,而是观察大规模强化学习下的训练动态和涌现行为。

作者指出,直接放大训练会遇到可读性差、重复 token 多、推理深度不自适应等问题,因此加入了一套稳定高效的训练管线,包括:

论文给出的三个核心结论是:

在 7 个数学基准上,Ring-2.5-1T-Zero 表现具有竞争力。作者还提出了一个从 comprehensibility / reproducibility / efficiency 三个维度评价 CoT 质量的结构化框架。

所属事件:万亿参数Zero RL模型Ring-Zero发布(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →