TRL v1.15 默认启用融合 LM head,省显存八成、序列更长
Hugging Face 发布 TRL v1.15,官方称之为史上最大优化。SFT、DPO、KTO、GRPO、RLOO 和蒸馏等后训练方法默认改用融合 LM head,实现显著省显存效果:峰值 VRAM 最高降低 82%,可训练序列长度最高拉长约 6.9 至 7 倍。此次更新聚焦后训练优化,让有限显存下训练更长序列成为可能。
2026-10-09 ~ 2026-10-09 · 2 条相关
- TRL v1.15 融合 LM head,峰值显存省 82%、序列长 7 倍 — QGallouedec · 2026-10-09
- TRL v1.15 默认启用融合 LM head,训练序列长度最高拉长 6.9 倍 — LysandreJik · 2026-10-09