RLVR 论文被引,RAFT 方法同样在训练时做 best-of-k 采样

burny_tech · x · 2026-08-02

博主 burnytech 指出,在讨论 LLM 的 pass@k RLVR(强化学习验证)论文时,RAFT(Reward rAnked FineTuning)方法同样在训练阶段采用 best-of-k 策略。RAFT 利用奖励模型和足够数量的样本,筛选高质量样本并丢弃不良行为样本,然后在这些过滤后的样本上进行微调,以对齐生成式基础模型。该方法旨在解决 RLHF 中 RL 算法的低效和不稳定问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →