Ring-2.5-1T-Zero 将 RL 扩展到 1T 参数
kastnerkyle · x · 2026-07-21
这条转发介绍了一篇关于 Ring-2.5-1T-Zero 的研究,重点是把强化学习扩展到 1T 参数模型的多阶段训练管线。
训练流程
- 第一阶段 RL:用 token 级损失激励推理
- 自蒸馏:压缩 CoT 轨迹,缩小训练/推理差距
- 第二阶段 RL:改为 sample 级损失,继续提升能力
- 第三阶段 RL:用分层训练,让模型适应不同深度的推理
其他内容
- 论文还提到大规模训练的基础设施优化,包括混合精度控制和 context parallel 优化。
- 图中总结了若干涌现行为:拟人化、结构化格式、并行推理、context anxiety。
结果
- 表格对比了 frontier models 与多个 Zero-RL 变体在 AIME 2024/2025/2026、HMMT、IMOAnswerBench 等数学基准上的表现。
- Ring-2.5-1T-Zero 的分阶段版本相较早期 Zero-RL baseline 有明显提升,其中第三阶段版本在列出的 Ring 系列里成绩最好。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22