Rufus-Air 论文:按奖励可靠性排序 post-training 阶段炼出开源模型

burny_tech · x · 2026-09-27

开源 LLM post-training 配方论文 Rufus-Air 提出按「奖励可靠性」从高到低排列训练阶段:先用硬性可验证奖励,再过渡到较软的 judge 信号,无需新增人工标注即可训练出有竞争力的开源模型。

对自建模型或领域 agent 的工程实践者来说,论文给出了一份复杂后训练的完整蓝图,涵盖:奖励设计、按 prompt 难度过滤数据、通用/编码/搜索三类 agent 能力训练,以及多阶段 RL 的训练稳定性处理。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →