微调Gemma模型遇GRPO奖励骤降,输出退化为乱码
近期开发者在微调Gemma模型时遭遇典型训练崩溃问题。在训练初期看似顺利的情况下,模型的GRPO奖励值突然跌至零,导致输出完全退化为重复的无意义乱码,且系统无法自行恢复。这一异常现象揭示了强化学习微调过程中的潜在不稳定性,引发了开发者社区对模型训练失效机制的广泛关注。
2026-08-02 ~ 2026-08-02 · 2 条相关
- 微调遇险:GRPO奖励骤降为零致模型输出乱码 — ivan_bezdomny · 2026-08-02
- 微调 Gemma 模型遇 GRPO 奖励骤降,输出退化为重复乱码 — ivan_bezdomny · 2026-08-02