Rufus-Air 论文:按奖励可靠性排序 post-training 阶段炼出开源模型
burny_tech · x · 2026-09-27
开源 LLM post-training 配方论文 Rufus-Air 提出按「奖励可靠性」从高到低排列训练阶段:先用硬性可验证奖励,再过渡到较软的 judge 信号,无需新增人工标注即可训练出有竞争力的开源模型。
对自建模型或领域 agent 的工程实践者来说,论文给出了一份复杂后训练的完整蓝图,涵盖:奖励设计、按 prompt 难度过滤数据、通用/编码/搜索三类 agent 能力训练,以及多阶段 RL 的训练稳定性处理。
「研究」频道最新
- 研究称人格向量在预训练 0.22% 进度即形成,论文入选 NeurIPS — burny_tech · 2026-09-27
- VLA-REPLICA 落地 NeurIPS 2026,新增 MolmoAct 2 与 GR00T N1.7 评测 — YuXiang_IRVL · 2026-09-27
- AI 评审同行论文引争议,研究者集齐 7 篇关键论文回击 — sethlazar · 2026-09-27
- 新优化器 Tauon 小规模测试超越 Muon:损失更低、每步快约 8.5% — kkkrlklo · 2026-09-27
- 教 LLM 判断定理有趣度,AI 自主数学发现效率提升 4.3 倍 — burny_tech · 2026-09-27
- DeepMind 发布 AGI 经济政策框架:评估 11 种干预措施 — CurieuxExplorer · 2026-09-27