TRL 通过 OpenEnv 原生支持真实 harness 训练
LysandreJik · x · 2026-07-24
TRL 通过 OpenEnv 原生支持 agent harness 训练
TRL 新增了通过 OpenEnv 直接在 agent harness 上训练的能力,开发者可以更方便地把真实编程智能体流程接进训练管线。
- 现在可以直接使用类似 opencode 这样的 harness 进行训练,减少额外的胶水代码。
- 配图展示了一个由 policy、agent、proxy、verifier 组成的闭环,以及 message-level rollouts、padding-free dynamic packing 等训练组件。
- 这意味着 TRL 更适合处理真实的多轮 agent transcript 和长时序 episode,对编程智能体训练的工程实践更有用。
所属事件:TRL 联合 OpenEnv 支持自定义智能体训练(4 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11