Qwen 发布 TRACE:FP4 量化 RL 训练 MoE 模型,rollout 提速 5.4 倍
Qwen · hf · 2026-10-07
Qwen 团队提出 TRACE,一种面向 MoE 语言模型强化学习训练的 FP4 量化框架。
- 痛点:RL 后训练中 rollout 生成开销巨大,现有 FP4 RL 方法分别独立优化训练与 rollout 两条量化路径,未直接缩小两者差异。
- 方法:TRACE 用 rollout 侧量化结果引导训练侧 FP4 舍入决策,直接对齐训练与 rollout 路径;并采用量化信息缓存方案,选择性保留深层尾数与 scale 信息,降低引导带来的存储与通信开销。
- 结果:在四个大规模 MoE 模型上,FP4 权重/激活与 FP4 KV-cache rollout 联合训练的 RL 性能与 BF16 rollout 相当,rollout 最高加速 5.4 倍,且最终 FP4 性能优于 BF16 训练后的事后量化。
「Infra」频道最新
- Intel 研究员:把 temp=0 当成 LLM 完全确定性的人我不会雇 — JFPuget · 2026-10-07
- 华为灵衢互联+Peerium 集群 MFU 达 35%,约美国集群两倍 — teortaxesTex · 2026-10-07
- you.com 搜索进 RL 循环训练 Nemotron,BrowseComp 升至 45.45% — PolarBearby · 2026-10-07
- Meta 出身工程师:本地模型追赶前沿速度远超外界认知 — Scobleizer · 2026-10-07
- 本地语音模型工具对决:audio.cpp 100+ 模型对阵 VoiceStudio — pilkyton · 2026-10-07
- RTX 5090 跑 MiniMax H3 整机断电:更新 ComfyUI 栈后不再复现 — Zealousideal-Gate282 · 2026-10-07