微调 Gemma 模型遇 GRPO 奖励骤降,输出退化为重复乱码

ivan_bezdomny · x · 2026-08-02

开发者在微调 Gemma 模型时遭遇异常:训练初期一切正常,但随后 GRPO 奖励突然降至零。模型输出完全退化为重复的无意义乱码,且无法自行恢复。

所属事件:微调Gemma模型遇GRPO奖励骤降,输出退化为乱码(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →