FP8 统一用于训练与推理解码,RL 端到端提速 16%
joecole · x · 2026-07-30
NVIDIA、MIT 等机构联合发布的新论文 Jet-RL 深入研究了在大语言模型(LLM)的强化学习(RL)训练中使用 FP8 量化的稳定性问题。
- 传统痛点:RL 训练中,推理解码阶段通常占用 70% 以上的时间。此前常见的做法是训练用 BF16、推理解码用 FP8,但这会导致严重的数值不匹配,引发训练不稳定甚至精度崩溃。
- Jet-RL 方案:提出在训练和推理解码阶段统一采用 FP8 精度流,从而最小化数值差异,避免了低效的跨步骤校准。
- 性能提升:实验表明,该方法在推理解码阶段实现了最高 33% 的加速,训练阶段加速达 41%,端到端整体提速 16%,同时保持了稳健的模型精度。
「Infra」频道最新
- SK海力士财报分析:AI内存需求强劲,市场过虑产能过剩 — tengyanAI · 2026-07-30
- 单机 8x 5090 实现 167k tokens/s 训练吞吐,超越 DDP 基线 — jon_durbin · 2026-07-30
- Buildcleaner 开源工具可清理 443GB 构建缓存,免费 MIT 许可 — jasonkneen · 2026-07-30
- 大模型推理成本骤降:B200 单价已跌破 3 美元 — AccBalanced · 2026-07-30
- 为逃避 API 费用狂攒 GPU,发现单张 5090 足以应对日常 — Ok-Shower7286 · 2026-07-30
- Yann LeCun 等探讨:LLM 是新型编译器,性能取决于算力 — yisongyue · 2026-07-30