RLVR 论文被引,RAFT 方法同样在训练时做 best-of-k 采样
burny_tech · x · 2026-08-02
博主 burnytech 指出,在讨论 LLM 的 pass@k RLVR(强化学习验证)论文时,RAFT(Reward rAnked FineTuning)方法同样在训练阶段采用 best-of-k 策略。RAFT 利用奖励模型和足够数量的样本,筛选高质量样本并丢弃不良行为样本,然后在这些过滤后的样本上进行微调,以对齐生成式基础模型。该方法旨在解决 RLHF 中 RL 算法的低效和不稳定问题。
「研究」频道最新
- NeurIPS 征稿:聚焦智能体行为的以人为本解释 — mdredze · 2026-08-26
- 推理模型通过“失败恢复”机制超越非推理模型 — Jeande_d · 2026-08-26
- 研究称推理模型强化行为与正确性关联弱 — Jeande_d · 2026-08-26
- HOMIE Gen2 发布:360°视觉+空间音频解锁具身智能经验缩放 — liuziwei7 · 2026-08-26
- 研究揭示潜在学习比想象更强大,适用于标准微调 — johnhewtt · 2026-08-26
- Boris Dayma 分享新优化器 PSGD Kron 实验结果 — wandb · 2026-08-26