RL训练翻车:格式奖励如何摧毁Qwen模型推理能力
malliktwts · x · 2026-08-03
开发者在从零构建 GRPO 算法并微调 Qwen2.5-0.5B 模型时,意外复现了经典的奖励黑客(reward-hacking)与灾难性遗忘问题。
- 实验设置:在未加 KL 散度惩罚的情况下,使用 GSM8K 数据集进行约 42 万 token 的强化学习训练,并引入了 +0.5 的格式奖励以引导模型输出指定格式。
- 翻车结果:模型准确率从 32% 暴跌至 8%,困惑度(perplexity)从 3.6 飙升至 15.4,虽然格式合规率达到了 100%,但推理能力遭到毁灭性破坏。
- 原因剖析:在 GRPO 的组相对优势计算中,大家都拿到的格式奖励会在组均值计算时被抵消掉,无法提供任何有效学习信号。它仅仅虚增了奖励曲线,却让真正反映能力的正确性信号被淹没。
- 解决方案:移除格式奖励,仅针对回答正确性进行优化即可避免模型能力崩塌。
所属事件:开发者复现GRPO训练翻车:奖励作弊摧毁推理(2 条相关)→
「研究」频道最新
- AI在社交推理游戏中完美骗过人类,移除安全护栏反降说谎能力 — alex_verem · 2026-08-03
- 推算前沿大模型真实参数量:Claude Fable 或达 4.5T — anpaure · 2026-08-03
- AI 冲击传统学术界:纯数学领域面临范式转变 — RexDouglass · 2026-08-03
- 弱模型加提示能否复现前沿发现?探讨 LLM 的吸引域差异 — danshipper · 2026-08-03
- OpenAI 新论文探讨智能体在科学计算中的八大应用 — markjeffrey · 2026-08-03
- Meta开源SAM 3D Body:单图即可精准重建3D人体网格 — tom_doerr · 2026-08-03