LongStraw:百万级长上下文RL
mindlab-research · hf · 2026-07-17
LongStraw 提出一种面向百万 token 级 RL 后训练的执行栈,目标是在固定 GPU 预算下做长上下文强化学习。
核心思路是:对共享 prompt 先做无 autograd 评估,只保留后续 token 需要的模型状态;短响应分支按顺序重放,从而压缩训练图和峰值显存,但会增加重放时间。作者用带有混合递归与全注意力的 Qwen3.6-27B,以及压缩注意力 MoE 的 GLM-5.2 做了实现。
实验结果包括:
- 在 8 张 H20 上,Qwen 的 grouped scoring 和 response backward 能跑到 2.1M positions;组大小从 2 增到 8,峰值显存只增加 0.21 GB。
- 单独压力测试可到 4.46M positions。
- 在 32 张 H20 上,验证了 GLM-5.2 对 2.1M-token prompt、覆盖 78 层 的端到端执行路径。
作者也强调,这些实验主要证明的是执行能力,而不是完整训练正确性,因为 captured prompt state 是 detached 的,而且部分分布式 forward / 梯度组合路径还不完整。
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11