TRL 与 OpenEnv 让 agent 在自定义编码 harness 里训练
ben_burtenshaw · x · 2026-07-24
可以在 TRL + OpenEnv 里,使用自己选择的 harness 来训练 agent,比如 OpenCode、pi、Codex、Claude Code。
- 核心思路是:让模型在它真实使用的同一套上下文/工具环境里训练,这样它会更会用正确工具完成任务,而不是只学到抽象能力。
- 作者给出的流程是:准备任务数据集 → 用一个 harness 驱动 session → 接入 OpenEnv 环境和 adapter → 通过 TRL HarnessRolloutWorker 采集轨迹 → 用 AsyncGRPOTrainer 根据环境 reward 更新权重。
- 配图把整个循环画得很清楚:代码任务 + verifier → agent 执行 → 环境验证 → rollout 采样 → policy 更新。
所属事件:TRL 联手 OpenEnv 支持在自定义 harness 训练 agent(3 条相关)→
「编程与Agent」频道最新
- Grok Build 把工作流变成可调用的智能体命令 — tetsuoai · 2026-07-24
- Grok Build 把工作流扩展到最多 1024 个智能体 — tetsuoai · 2026-07-24
- “主 Agent” 模式把子 Agent 当成一组 MapReduce 工人 — dotey · 2026-07-24
- Anakin 推出面向 agent loop 的自托管抓取层 — Roger_M_Taylor · 2026-07-24
- Netlify 伦敦活动主打 AI 实时构建和 agent 演示 — thisiskp_ · 2026-07-24
- Reddit 发出一张 Agent 基础设施周期表 — ozzyboy · 2026-07-24