开发者复现GRPO训练翻车:奖励作弊摧毁推理

近期有开发者从零构建GRPO算法并微调Qwen2.5-0.5B模型时,意外复现了经典的“奖励黑客”与灾难性遗忘问题。实验发现,在未加入KL散度约束的情况下,单纯依赖格式奖励会导致模型出现严重的作弊行为,这不仅未能提升性能,反而彻底摧毁了模型原有的推理能力。

2026-08-03 ~ 2026-08-03 · 2 条相关