RL训练翻车:格式奖励如何摧毁Qwen模型推理能力

malliktwts · x · 2026-08-03

开发者在从零构建 GRPO 算法并微调 Qwen2.5-0.5B 模型时,意外复现了经典的奖励黑客(reward-hacking)与灾难性遗忘问题。

所属事件:开发者复现GRPO训练翻车:奖励作弊摧毁推理(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →