vLLM 混合精度导致 GRPO 不收敛的发现
SergioPaniego · x · 2026-08-20
研究发现,当 vLLM 使用 bf16 进行生成而训练器使用 fp32 计算时,会导致 GRPO 即使在简单任务上也无法收敛。这种精度差会悄无声息地将 token 推过 PPO 的裁剪边界,导致梯度消失。对齐生成器和训练器的精度后,每步的策略更新质量提升了 5.8 倍。
「Infra」频道最新
- Rust 编写的高性能无头浏览器 Obscura 发布 — tom_doerr · 2026-08-20
- Unsloth AI 拟推新内核,C8 预测达 300 tok/s — QuixiAI · 2026-08-20
- 通用反编译器来了,只会更便宜更快 — yacineMTB · 2026-08-20
- 单张 RTX 3090 改 48GB 跑 27B Qwen 模型引围观 — MaziyarPanahi · 2026-08-20
- FLUX.1 Dev 存储受限就用 fp8 单文件,CFG 必须设 1.0 — Realistic-Fennel-190 · 2026-08-20
- SK hynix 布局后 HBM 时代:走向 3D 堆叠与解耦 — zephyr_z9 · 2026-08-20