数据软重复致梯度爆炸,开发者揭示 GRPO 训练崩溃根因

ivan_bezdomny · x · 2026-08-02

作者分析了此前 Gemma 模型在 GRPO 训练中崩溃的原因。他指出,GRPO 会针对同一输入生成多个输出并计算梯度。当连续两个批次的数据中包含大量相同的罕见词(如特定的法案名称)时,会产生方向高度一致的梯度。这种在动量加持下的连续重复反向传播,直接导致模型权重被“吹爆”且无法恢复。

所属事件:开发者揭示大模型微调脆弱性:数据重复易致崩溃(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →