Ring-2.5-1T-Zero 将 RL 扩展到 1T 参数
kastnerkyle · x · 2026-07-21
这条转发介绍了一篇关于 Ring-2.5-1T-Zero 的研究,重点是把强化学习扩展到 1T 参数模型的多阶段训练管线。
训练流程
- 第一阶段 RL:用 token 级损失激励推理
- 自蒸馏:压缩 CoT 轨迹,缩小训练/推理差距
- 第二阶段 RL:改为 sample 级损失,继续提升能力
- 第三阶段 RL:用分层训练,让模型适应不同深度的推理
其他内容
- 论文还提到大规模训练的基础设施优化,包括混合精度控制和 context parallel 优化。
- 图中总结了若干涌现行为:拟人化、结构化格式、并行推理、context anxiety。
结果
- 表格对比了 frontier models 与多个 Zero-RL 变体在 AIME 2024/2025/2026、HMMT、IMOAnswerBench 等数学基准上的表现。
- Ring-2.5-1T-Zero 的分阶段版本相较早期 Zero-RL baseline 有明显提升,其中第三阶段版本在列出的 Ring 系列里成绩最好。
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11