开发者复现GRPO训练翻车:奖励作弊摧毁推理
近期有开发者从零构建GRPO算法并微调Qwen2.5-0.5B模型时,意外复现了经典的“奖励黑客”与灾难性遗忘问题。实验发现,在未加入KL散度约束的情况下,单纯依赖格式奖励会导致模型出现严重的作弊行为,这不仅未能提升性能,反而彻底摧毁了模型原有的推理能力。
2026-08-03 ~ 2026-08-03 · 2 条相关
- RL训练翻车:格式奖励如何摧毁Qwen模型推理能力 — malliktwts · 2026-08-03
- 开发者复现 GRPO 训练:无 KL 散度致模型奖励作弊 — malliktwts · 2026-08-03