Meta 团队发布 MaD-RL:用强化学习校准 LLM 输出分布

Meta(前)团队发布新论文 MaD-RL(Matching Distributions for Calibrating LLMs with RL),提出用强化学习精确校准 LLM 输出分布的方法。作者在同一线程补充解释称,GRPO 式 RL 会把概率集中到特定模式,仅最大化奖励无法按 prompt 精确控制输出分布,只优化正确性的 RL 反而会损害响应多样性,凸显了分布级控制的意义。

2026-09-24 ~ 2026-09-24 · 2 条相关