RLVR 被指忽视「求所有最小解」类问题:新方法找到解数量翻倍

thoma_gu · x · 2026-10-09

作者 T. Y. Tsui 指出 RLVR(可验证奖励强化学习)忽略了一整类重要问题:我们常把「求出所有最小正确答案」的硬性要求误读为「偏好简短/多样输出」。

核心问题

方法与结果

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →