前沿实验室怎么做 agent RL:每个 rollout 一个沙箱
SergioPaniego · x · 2026-09-11
这是作者「Training Agents」系列课程第 4 课(用 TRL + OpenEnv 在真实环境中训练编码 agent)的配套博客,也是其前沿模型报告复盘三部曲的最后一篇:
- 问题本质:agent 会跑代码、浏览网页、多轮编辑文件,训练它需要一个所有行为都能发生的地方,还要有让数千个这样的环境同时运行的基础设施。
- 内容:作者梳理了 2026 年前沿实验室(此前两篇分别讲蒸馏与结果导向训练)在大规模 agent RL 训练中构建的沙箱/环境方案,解释它们如何在模型训练时维持成千上万个隔离 rollout 环境。
- 前两篇复盘已覆盖蒸馏使用方式与基于结果的训练,本篇聚焦所有训练发生的「场所」本身。
「Infra」频道最新
- Qdrant 宣布三场免费社区活动:4 小时向量技术长直播压轴 — qdrant_engine · 2026-09-11
- 国内 B300 现货喊到 1600 万一台,3 倍溢价把国产卡推成推理最优解 — aigclink · 2026-09-11
- 实测:RunPod 自托管 Qwen 27B 生成仅 17 tok/s,长输出成本反输 OpenAI — yeah280 · 2026-09-11
- antirez 总结:encoder/decoder 共享 KV 架构让本地低显存场景也能极速大 prefill — antirez · 2026-09-11
- vLLM 详解 MiniMax M3 在 AMD MI355X 上的调优:单卡吞吐提升至 4.45 倍 — vllm_project · 2026-09-11
- antirez 详解 DwarfStart 三级 prefill 策略:按长度切换 token 路径与分层加载 — antirez · 2026-09-11