长上下文 RL 基础设施用 partial rollout 支撑 100 万 token 训练
SeunghyunSEO7 · x · 2026-07-28
这条帖子结合配图讨论了 agentic RL 的长上下文训练基础设施,包括 partial rollout、外部 KV cache 存储和可恢复执行等细节。
配图来自论文中 “Infra for 1M Agentic RL” 一节,说明通过 co-located RL training 与 partial rollout,可以把 1M context 的 Kimi K3 实验控制在几百张 GPU 内;但代价是回滚阶段的 KV cache 必须保留到下一轮,从而显著增加内存压力。
「Infra」频道最新
- YC 孵化的 Atomarine 要把数据中心建到海上并接入 SMR — ycombinator · 2026-07-28
- 居民因鼓掌反对建数据中心遭逮捕,AI算力扩张引社会摩擦 — 404 Media · 2026-07-28
- Kimi K3 的 tokenizer 优化把首 token 延迟降了约 325 毫秒 — philipkiely · 2026-07-28
- Ben Bajarin 复盘:AI 最大误判是低估 GPU 供应链浪潮 — BenBajarin · 2026-07-28
- Palantir 称其美国政府 AI 平台基于开源权重和 NVIDIA GPU — eliano · 2026-07-28
- Kimi K3 上线 Dell 服务器,支持 day-0 本地部署 — _akhaliq · 2026-07-28