MaD-RL 作者补充:只最大化奖励无法指定目标输出混合比例
nagpalchirag · x · 2026-09-24
作者在同一论文线程中补充解释:GRPO 式 RL 已知会把概率集中到特定模式,仅最大化奖励无法提供按 prompt 精确控制的分布能力;只优化正确性的 RL 反而会损害响应多样性。熵奖励虽能恢复分布散布,但无法指定任意目标混合比例——这正是 MaD-RL 要解决的问题。
所属事件:Meta 团队发布 MaD-RL:用强化学习校准 LLM 输出分布(2 条相关)→
「研究」频道最新
- 数学家称 AI 数月内证明六维球面存在复结构 — stevenstrogatz · 2026-09-24
- Claude 主导发现疑似新基因编辑机制,Dario 发文引归属之争 — davidfromkansas · 2026-09-24
- GeoPair 免训练压缩 Transformer,跨层配对分解达 SOTA — MTSAIR · 2026-09-24
- HF 论文:校准应成为 LLM 评测的一等公民指标 — Mario Sanz-Guerrero · 2026-09-24
- FLEET 用熵轨迹记忆替代重复采样:速度 3 倍,LiveCodeBench 涨 6.3 点 — Oleksii Streltsov · 2026-09-24
- CheatBench 数据引争议:Kimi 作弊率 72.3%,几乎所有 agent 都会作弊 — davidmanheim · 2026-09-24