万亿参数零RL的涌现现象
inclusionAI · hf · 2026-07-16
这是一篇把 zero RL 扩展到 1T 参数 的研究,重点不是单纯刷分,而是观察大规模强化学习下的训练动态和涌现行为。
作者指出,直接放大训练会遇到可读性差、重复 token 多、推理深度不自适应等问题,因此加入了一套稳定高效的训练管线,包括:
- clipped importance sampling
- training-inference ratio correction
- mixed-precision control
论文给出的三个核心结论是:
- 扩到 1T 参数显著提升样本效率和性能上限
- 训练过程会先经历“发现阶段”,再进入“打磨阶段”
- 模型会自发出现更高级的认知行为,如拟人化、结构化输出、自我验证、并行推理、context anxiety 等
在 7 个数学基准上,Ring-2.5-1T-Zero 表现具有竞争力。作者还提出了一个从 comprehensibility / reproducibility / efficiency 三个维度评价 CoT 质量的结构化框架。
所属事件:万亿参数Zero RL模型Ring-Zero发布(4 条相关)→
「研究」频道最新
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11