LongStraw:百万级长上下文RL

mindlab-research · hf · 2026-07-17

LongStraw 提出一种面向百万 token 级 RL 后训练的执行栈,目标是在固定 GPU 预算下做长上下文强化学习。

核心思路是:对共享 prompt 先做无 autograd 评估,只保留后续 token 需要的模型状态;短响应分支按顺序重放,从而压缩训练图和峰值显存,但会增加重放时间。作者用带有混合递归与全注意力的 Qwen3.6-27B,以及压缩注意力 MoE 的 GLM-5.2 做了实现。

实验结果包括:

作者也强调,这些实验主要证明的是执行能力,而不是完整训练正确性,因为 captured prompt state 是 detached 的,而且部分分布式 forward / 梯度组合路径还不完整。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →