MaD-RL 作者补充:只最大化奖励无法指定目标输出混合比例

nagpalchirag · x · 2026-09-24

作者在同一论文线程中补充解释:GRPO 式 RL 已知会把概率集中到特定模式,仅最大化奖励无法提供按 prompt 精确控制的分布能力;只优化正确性的 RL 反而会损害响应多样性。熵奖励虽能恢复分布散布,但无法指定任意目标混合比例——这正是 MaD-RL 要解决的问题。

所属事件:Meta 团队发布 MaD-RL:用强化学习校准 LLM 输出分布(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →