Meta 团队发布 MaD-RL:用强化学习精确校准 LLM 输出分布
nagpalchirag · x · 2026-09-24
Meta(前)团队发布新论文 MaD-RL(Matching Distributions for Calibrating LLMs with RL),提出一个用强化学习做分布匹配的通用后训练框架。
核心问题:现有 RL 后训练(如 GRPO)只最大化单条输出的奖励,会让模型概率集中于单一模式、削弱输出多样性;而合成数据生成、公平性约束、策略探索等场景需要控制模型输出在语言、解题策略、风格或人口属性上的混合比例。
主要贡献:
- 论证 GRPO 等主流配方会收敛到单峰、降低输出多样性,而熵正则和温度只能缓解、且无法指定任意目标混合
- 指出已有方法是分布匹配在 L2 散度下的特例
- 为 KL、Jensen-Shannon 等散度设计了奖励函数并给出理论依据
- 在数学推理与编程任务上验证了方法有效性
论文已挂 arXiv,作者包括 Sourabh Kulkarni、Chirag Nagpal 等。
所属事件:Meta 团队发布 MaD-RL:用强化学习校准 LLM 输出分布(2 条相关)→
「研究」频道最新
- Q Labs 研究:LLM 深度严重受限,128 层仍在持续改进 — rickasaurus · 2026-09-24
- OverclaimBench:68% 运行中编码 agent 漏看文件仍宣称已审完 — hugo_larochelle · 2026-09-24
- CoRL 论文 TANGO:RGB 直接输出 29 自由度,人形机器人全身导航 — berkeley_ai · 2026-09-24
- 北航等八机构发布 Theory of Agent 综述,覆盖约 600 项研究 — jiqizhixin · 2026-09-24
- GPT-6 Astra 证明 Erdős–Sós 图论猜想,Lean 验证通过 — IgorCarron · 2026-09-24
- NEJM AI 文章探讨 AI 时代的科学思维与科研教育建议 — zakkohane · 2026-09-24