TRL v1.15 默认启用融合 LM head,省显存八成、序列更长

Hugging Face 发布 TRL v1.15,官方称之为史上最大优化。SFT、DPO、KTO、GRPO、RLOO 和蒸馏等后训练方法默认改用融合 LM head,实现显著省显存效果:峰值 VRAM 最高降低 82%,可训练序列长度最高拉长约 6.9 至 7 倍。此次更新聚焦后训练优化,让有限显存下训练更长序列成为可能。

2026-10-09 ~ 2026-10-09 · 2 条相关