ClawGym II 论文:混合跨工具训练 Agent
omarsar0 · x · 2026-08-19
这篇论文提出了 ClawGym II,一种通过现有的代码执行工具来训练 Agent 的方法。系统在模型边界设置服务代理,捕获工具(如 OpenClaw 和 Claude Code)的调用记录,并将其组织成前缀树,使 PPO 和 GRPO 能够在恢复的多轮结构上进行优化。实验显示,Qwen3-30A3B 模型通过该方法在 Pass@1 指标上获得了显著提升(OpenClaw +9.98,Claude Code +14.81)。此外,混合工具训练显示模型可以在不同执行系统之间泛化,而非过拟合于单一工具。
所属事件:人大发布 ClawGym II,黑盒 RL 直接训练复杂 Agent(3 条相关)→
「编程与Agent」频道最新
- React Grab 助 Agent 2 倍提效,精准定位 UI 源码 — aidenybai · 2026-08-19
- 坚持构建高质量基础库是长期被忽视的工程关键 — wavefnx · 2026-08-19
- Grok Bot 底层原理:基于受管 VM 的 Agent 控制 — noahsolomon · 2026-08-19
- 技术建议:SKILL.md 格式需支持条件编译 — mertdumenci · 2026-08-19
- OpenAI Codex CLI v0.148.0 发布:支持导出对话、Bedrock 集成 — github-actions[bot] · 2026-08-19
- Genkit Go 1.12:扩容模型与优化错误 — rseroter · 2026-08-19