vLLM 混合精度导致 GRPO 不收敛的发现

SergioPaniego · x · 2026-08-20

研究发现,当 vLLM 使用 bf16 进行生成而训练器使用 fp32 计算时,会导致 GRPO 即使在简单任务上也无法收敛。这种精度差会悄无声息地将 token 推过 PPO 的裁剪边界,导致梯度消失。对齐生成器和训练器的精度后,每步的策略更新质量提升了 5.8 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →