TRL v1.15 默认启用融合 LM head,训练序列长度最高拉长 6.9 倍

LysandreJik · x · 2026-10-09

Hugging Face 的 TRL v1.15 发布,主打省显存的后训练优化:SFT、DPO、KTO、GRPO、RLOO 和蒸馏默认改用 fused LM head——不再物化庞大的 [batch, seq, vocab] logits 张量,而是用 Triton kernel 直接计算所需的 token 级量。

实测(Gemma 3 1B,26.2 万词表,同一 GPU):

序列长度最高 6.9 倍提升,8k 上下文峰值显存降低 52-82%,训练速度反而快约 11%。无需任何配置,v1.15 默认生效。其他更新包括 SFT 的选择性激活检查点、视觉数据集的 assistant-only loss、对话日志改进等。

所属事件:TRL v1.15 默认启用融合 LM head,省显存八成、序列更长(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →