无需侵入内部,黑盒RL训练Agent提升近15点

rohanpaul_ai · x · 2026-08-22

ClawGym II 提出一种黑盒强化学习方法,允许在不获取 Agent 框架(如 OpenClaw 或 Claude Code)内部逻辑的情况下进行 RL 训练。该框架在沙盒中运行这些工具,拦截服务边界的模型调用,并将碎片化调用重构成 PPO 或 GRPO 可优化的前缀树轨迹。

核心要点

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →