TRL v1.15 默认启用融合 LM head,训练序列长度最高拉长 6.9 倍
LysandreJik · x · 2026-10-09
Hugging Face 的 TRL v1.15 发布,主打省显存的后训练优化:SFT、DPO、KTO、GRPO、RLOO 和蒸馏默认改用 fused LM head——不再物化庞大的 [batch, seq, vocab] logits 张量,而是用 Triton kernel 直接计算所需的 token 级量。
实测(Gemma 3 1B,26.2 万词表,同一 GPU):
- DPO:10k → 59k 最大序列长度
- KTO:9k → 63k
- GRPO:28k → 114k
- RLOO:23k → 100k
- SFT:20k → 107k
序列长度最高 6.9 倍提升,8k 上下文峰值显存降低 52-82%,训练速度反而快约 11%。无需任何配置,v1.15 默认生效。其他更新包括 SFT 的选择性激活检查点、视觉数据集的 assistant-only loss、对话日志改进等。
所属事件:TRL v1.15 默认启用融合 LM head,省显存八成、序列更长(2 条相关)→
「Infra」频道最新
- 分析师提醒:五年供应协议≠五年锁价,三星涨价或最猛 — tengyanAI · 2026-10-09
- 8GB 显存笔记本跑通 MiniMax-H3 视频生成,作者求推荐文生图模型 — Zoaloo · 2026-10-09
- 推理算力交易所涌现:智能走向大宗商品化 — metehan777 · 2026-10-09
- Qwen3.8-flash 本地实测:Strix Halo 与 3090 双双跑出约 50 tok/s — drdanielbender · 2026-10-09
- 本地推理装机:Epyc 7443 + 四卡 72GB VRAM,总显存 328GB — mrgreatheart · 2026-10-09
- Synopsys 拟与中国 AI 实验室合作加速芯片设计,预测 FY27 营收 111.5 亿美元 — pstAsiatech · 2026-10-09