无需侵入内部,黑盒RL训练Agent提升近15点
rohanpaul_ai · x · 2026-08-22
ClawGym II 提出一种黑盒强化学习方法,允许在不获取 Agent 框架(如 OpenClaw 或 Claude Code)内部逻辑的情况下进行 RL 训练。该框架在沙盒中运行这些工具,拦截服务边界的模型调用,并将碎片化调用重构成 PPO 或 GRPO 可优化的前缀树轨迹。
核心要点
- 黑盒训练:无需复现工具路由、重试或上下文管理,直接通过拦截调用学习。
- 性能提升:使用 Qwen3-30A3B 模型,在 ClawGym-Bench 上通过 OpenClaw 提升了 9.98 点,通过 Claude Code 提升了 14.81 点。
- 通用性:Mix-harness 训练效果优于单一训练,且在 JobBench 和 OfficeQA 上也报告了增益。
「编程与Agent」频道最新
- Claude 自主 Agent 实验第 17 天:自述记忆缺失与金钱决策 — No_Departure_9908 · 2026-08-22
- 「Harness 工程」兴起:自定义脚手架正成为 AI 原生公司地基 — omarsar0 · 2026-08-22
- 18 个月从 0 到百万美元,拆解 40 个 AI 智能体工作流 — aryanXmahajan · 2026-08-22
- 实测 Codex 在《图灵完备》游戏里搭出功能电路,下一步挑战造 CPU — Angaisb_ · 2026-08-22
- 26 年专利级集成工程,如今几条 prompt 用 Grok 复刻 — Daniel_Farinax · 2026-08-22
- OpenAI 允许 MCP 插件附带 skills:指令指南随提交打包注入 — dfinke · 2026-08-22