万亿参数Zero RL模型Ring-Zero发布

最新发布的Ring-2.5-1T-Zero模型将Zero RL(零样本强化学习)成功扩展至1万亿参数规模。该模型直接从基座模型开始训练,全程无需额外人工标注。研究重点并非单纯刷分,而是探索大规模强化学习下的训练动态与涌现行为。研究发现,将RL扩展至万亿级别不仅会带来可读性差和重复输出等挑战,更成功激发了模型用于推理的涌现能力。

2026-07-16 ~ 2026-07-17 · 4 条相关