TRL v1.15 defaults to fused LM head, extending training sequences up to 6.9x
LysandreJik · x · 2026-10-09
Hugging Face shipped TRL v1.15, a memory-efficiency-focused release: SFT, DPO, KTO, GRPO, RLOO and distillation now default to a fused LM head — instead of materializing the huge [batch, seq, vocab] logits tensor, a Triton kernel computes token-level quantities directly.
Benchmarks (Gemma 3 1B, 262k vocab, same GPU):
- DPO: 10k → 59k max sequence length
- KTO: 9k → 63k
- GRPO: 28k → 114k
- RLOO: 23k → 100k
- SFT: 20k → 107k
Up to 6.9x longer sequences, peak memory at 8k context cut by 52-82%, and training is 11% faster. No config needed — it's the default. Other additions: selective activation checkpointing for SFT, assistant-only loss for vision datasets, better conversation logging.
Related event: TRL v1.15 Enables Fused LM Head by Default, Cutting Peak VRAM up to 82%(2 posts)→
More from Infra
- Running MiniMax-H3 video gen on an 8GB VRAM laptop, now asking for text-to-image picks — Zoaloo · 2026-10-09
- Inference Marketplaces Emerge as Intelligence Becomes a Commodity — metehan777 · 2026-10-09
- Local Qwen3.8-flash Test: Strix Halo and a 94GB-Modded RTX 3090 Both Hit ~50 tok/s — drdanielbender · 2026-10-09
- Local LLM rig: Epyc 7443, 256GB RAM, and 72GB VRAM across four GPUs — mrgreatheart · 2026-10-09
- Synopsys eyes Chinese AI labs for chip design, forecasts $11.15bn FY27 revenue — pstAsiatech · 2026-10-09
- NVIDIA NeMo-DCR cuts 1T-model RL weight sync from 87.5 min to 150 sec — IanAndrewsDC · 2026-10-09