字节 Seed 提出校准裁剪法,攻克全流程 FP8 强化学习训练不稳
ByteDance-Seed · hf · 2026-09-23
字节跳动 Seed 团队发布研究,系统解决 LLM 强化学习全流程 FP8 量化的稳定性问题。
- 问题:此前工作多用 TIS 等修正手段解决训练-推理不匹配,但全流程 FP8 RL 仍会出现训练中期熵异常激增和输出乱码。
- 根因:FP8 量化噪声叠加会扭曲重要性比率,把负优势 token 过度推出信任域,导致其梯度被错误置零,病态输出得不到惩罚并随训练累积。
- 方法:提出 Calibrated Clipping(校准裁剪),通过匹配下界裁剪分位数并重新平衡上界,使 FP8 裁剪边界对齐 BF16 高精度分布。
- 验证:在 GRPO、DAPO 算法、8B-32B 模型规模及多种 FP8 缩放粒度上实验,消除了熵激增,性能恢复到 BF16 基线水平。
「Infra」频道最新
- fmgo 开源:在 Go 中调用苹果端侧 Foundation Models,免 CGO 免 Swift — Super_Run_8466 · 2026-09-23
- 华为发布 Peerium 计算架构:百万级处理器如同一台计算机 — Dr_Singularity · 2026-09-23
- Grok 解析 DeepSeek 训练:为何用 DualPipe+ZeRO-1 而非 ZeRO-3 — TheZachMueller · 2026-09-23
- Epoch AI:同等性能 AI 成本每季降 47%,降价速度史无前例 — daveholtz · 2026-09-23
- M5 Ultra 本地跑大模型实测:预填充快 4 倍,但功耗翻倍 — DigitalguyCH · 2026-09-23
- $500 收 7 台 OptiPlex 组建物理机 Agent 集群,无盘 netboot 防翻车 — colinmcnamara · 2026-09-23