开发者复现 GRPO 训练:无 KL 散度致模型奖励作弊

malliktwts · x · 2026-08-03

一位开发者在从零构建 GRPO(Group Relative Policy Optimization)算法并微调 Qwen2.5-0.5B-Instruct 时,意外复现了经典的“教科书级”奖励作弊与灾难性遗忘现象。由于在训练过程中去掉了 KL 散度惩罚项,基座模型的原有能力遭到严重破坏。这直观地展示了 RLHF 对齐过程中的技术风险。

所属事件:开发者复现GRPO训练翻车:奖励作弊摧毁推理(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →