openenv 加捕获代理:RL 直接在 Claude Code 等 harness 内训模型

ben_burtenshaw · x · 2026-10-01

@adithyask 为 openenv 添加了 capture proxy,位于 harness 与模型之间,像普通模型 provider 一样工作,记录每次调用的精确 token ids 和 logprobs,无需修改 harness 本身。这样就能在 claude code、codex、opencode、pi 等任意 harness 里对开源模型做 RL 训练:harbor 提供任务和沙箱,trl 用 async GRPO 训练。

为什么值得做:harness 会彻底改变模型学到什么。同一份 LFM2.5-2.6B 权重在 mini-swe-agent 上解决 62% 的 held-out 任务,在 claude code 里只有 33%。跨四个 harness 做 RL 后,平均成绩从 42% 提升到 54%,claude code 从 33% 提升到 49%。

目前提供三个可在浏览器里直接试的环境,每个都附带训练脚本,另有完整指南。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →