TRL 和 OpenEnv 支持端到端训练编码智能体
SergioPaniego · x · 2026-07-24
- 这条帖子介绍了如何用 TRL + OpenEnv 训练自己的 编码智能体,起点是 opencode。
- 新增能力是端到端训练 agent harness:TRL 在 OpenEnv 会话里启动智能体,读取执行轨迹,重建训练样本,再用 AsyncGRPO 训练。
- OpenEnv 的作用是把 OpenCode 的运行环境和一个透明代理结合起来,记录每一步的 token id 和 logprobs。
- 核心思路是直接训练“真实跑工具的 agent 循环”,让策略从它自己生成的原始 token 中学习。
- 他们还给出了一个可复现示例:本地子进程沙箱 + DeepCoder 题目,并在 Qwen3-8B 上验证。
所属事件:TRL 联合 OpenEnv 支持自定义智能体训练(4 条相关)→
「编程与Agent」频道最新
- 开源包 trajectory 统一多家编码 Agent 会话格式 — carsonfarmer · 2026-07-24
- Vercel 让 Workflows 状态可固定到区域,AI Gateway 限制将上线 — cramforce · 2026-07-24
- ChatGPT Voice 使用建议:别在直播聊天里干活,改用新线程 — jxnlco · 2026-07-24
- 30 个开源 AI 仓库,覆盖 Agent、本地推理和自动化 — Shruti_0810 · 2026-07-24
- Context Engineering 2.0:共享记忆和子智能体成关键 — mdancho84 · 2026-07-24
- Context Engineering 2.0 指向“上下文协作”时代 — mdancho84 · 2026-07-24