Meta 团队发布 MaD-RL:用强化学习精确校准 LLM 输出分布

nagpalchirag · x · 2026-09-24

Meta(前)团队发布新论文 MaD-RL(Matching Distributions for Calibrating LLMs with RL),提出一个用强化学习做分布匹配的通用后训练框架。

核心问题:现有 RL 后训练(如 GRPO)只最大化单条输出的奖励,会让模型概率集中于单一模式、削弱输出多样性;而合成数据生成、公平性约束、策略探索等场景需要控制模型输出在语言、解题策略、风格或人口属性上的混合比例。

主要贡献:

论文已挂 arXiv,作者包括 Sourabh Kulkarni、Chirag Nagpal 等。

所属事件:Meta 团队发布 MaD-RL:用强化学习校准 LLM 输出分布(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →