openenv 加捕获代理:RL 直接在 Claude Code 等 harness 内训模型
ben_burtenshaw · x · 2026-10-01
@adithyask 为 openenv 添加了 capture proxy,位于 harness 与模型之间,像普通模型 provider 一样工作,记录每次调用的精确 token ids 和 logprobs,无需修改 harness 本身。这样就能在 claude code、codex、opencode、pi 等任意 harness 里对开源模型做 RL 训练:harbor 提供任务和沙箱,trl 用 async GRPO 训练。
为什么值得做:harness 会彻底改变模型学到什么。同一份 LFM2.5-2.6B 权重在 mini-swe-agent 上解决 62% 的 held-out 任务,在 claude code 里只有 33%。跨四个 harness 做 RL 后,平均成绩从 42% 提升到 54%,claude code 从 33% 提升到 49%。
目前提供三个可在浏览器里直接试的环境,每个都附带训练脚本,另有完整指南。
「编程与Agent」频道最新
- AIDE² 实现 AI 研究智能体递归自我改进:8 天 autonomous 运行连续 7 次升级自身 — krishnan · 2026-10-02
- LFM2.5 在不同 harness 里成绩差近一倍,用 RL 在 harness 内训练拉到 54% — _lewtun · 2026-10-02
- 开源工具 Codiff:本地 diff 查看器,一键生成 LLM 代码走查 — cnakazawa · 2026-10-02
- Warp 推出「Factories as Code」:用一份仓库把全部 Agent 配置起来 — vikvang1 · 2026-10-02
- Twin 推出 Twin Assistant:一个聊天框自动路由到你的 agent — socialwithaayan · 2026-10-02
- Fable 5.1 一句话把文档变成幻灯片,搞定 GPT-5.6 做不了的图内箭头 — every · 2026-10-02