微调Gemma模型遇GRPO奖励骤降,输出退化为乱码

近期开发者在微调Gemma模型时遭遇典型训练崩溃问题。在训练初期看似顺利的情况下,模型的GRPO奖励值突然跌至零,导致输出完全退化为重复的无意义乱码,且系统无法自行恢复。这一异常现象揭示了强化学习微调过程中的潜在不稳定性,引发了开发者社区对模型训练失效机制的广泛关注。

2026-08-02 ~ 2026-08-02 · 2 条相关