TRL 与 OpenEnv 让 agent 在自定义编码 harness 里训练
ben_burtenshaw · x · 2026-07-24
可以在 TRL + OpenEnv 里,使用自己选择的 harness 来训练 agent,比如 OpenCode、pi、Codex、Claude Code。
- 核心思路是:让模型在它真实使用的同一套上下文/工具环境里训练,这样它会更会用正确工具完成任务,而不是只学到抽象能力。
- 作者给出的流程是:准备任务数据集 → 用一个 harness 驱动 session → 接入 OpenEnv 环境和 adapter → 通过 TRL HarnessRolloutWorker 采集轨迹 → 用 AsyncGRPOTrainer 根据环境 reward 更新权重。
- 配图把整个循环画得很清楚:代码任务 + verifier → agent 执行 → 环境验证 → rollout 采样 → policy 更新。
所属事件:TRL 联合 OpenEnv 支持自定义智能体训练(4 条相关)→
「编程与Agent」频道最新
- MCP 链式调用无回滚:agent 工程的真实痛点 — agentrsdg · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- 用 Agent 造小分类器:19 万文档标注成本仅 0.7 美元 — vanstriendaniel · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11