长上下文 RL 基础设施用 partial rollout 支撑 100 万 token 训练

SeunghyunSEO7 · x · 2026-07-28

这条帖子结合配图讨论了 agentic RL 的长上下文训练基础设施,包括 partial rollout、外部 KV cache 存储和可恢复执行等细节。

配图来自论文中 “Infra for 1M Agentic RL” 一节,说明通过 co-located RL training 与 partial rollout,可以把 1M context 的 Kimi K3 实验控制在几百张 GPU 内;但代价是回滚阶段的 KV cache 必须保留到下一轮,从而显著增加内存压力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →