RLVR 被指忽视「求所有最小解」类问题:新方法找到解数量翻倍
thoma_gu · x · 2026-10-09
作者 T. Y. Tsui 指出 RLVR(可验证奖励强化学习)忽略了一整类重要问题:我们常把「求出所有最小正确答案」的硬性要求误读为「偏好简短/多样输出」。
核心问题
- 现有 RLVR 方法对每条 rollout 独立打分,无法区分「最小答案」与「冗余超集」、也无法区分「新解」与「重复解」,因此注定在此类任务上失败
- 例:化学反条件空间中,该找到的是「所有能正确产出结果的最小条件组合」,而非「全都要」的平凡解
方法与结果
- 作者推导出一种仅用 verifier 二元奖励的 credit assignment 方法
- 在 LLM 后训练中,新方法在 64 个样本内找到的每题最小正确答案数约为所有基线(含带最小性 oracle 的 GRPO)的 2 倍
- 博文约 20 分钟阅读,含完整问题分析与常见技巧为何失效的讨论
「研究」频道最新
- 亚琛工大开源 ARROW:任意 RGB 输入统一 3D 重建与点跟踪,刷新 SOTA — kwangmoo_yi · 2026-10-09
- HAIPS 2026 明日在 COLM 举行,隐私安全学者云集 — tianshi_li · 2026-10-09
- 用广义均值收紧贝叶斯误差的 Bhattacharyya 与 Chernoff 上界 — FrnkNlsn · 2026-10-09
- PAMI 框架:部件锚定让文生人物交互动作接触精度提升 14.5% — _akhaliq · 2026-10-09
- 研究揭示 LLM 当「新颖性评审」极不稳定,判定结果随设计选择剧烈波动 — _akhaliq · 2026-10-09
- 谷歌 AMIE 登上《柳叶刀》:真实门诊诊断与医生一致率达 90% — sundarpichai · 2026-10-09