人大ClawGymII:用Agent Harness直接训练模型
智东西 · wechat · 2026-08-18
核心思路:执行与优化解耦
中国人民大学高瓴人工智能学院提出ClawGymII框架,旨在通过真实的Agent Harness(如ClaudeCode、OpenClaw)直接进行黑盒强化学习,而非仅利用其生成的离线数据。
解决痛点:
- 可扩展执行:使用Sandbox隔离每个任务的Rollout,支持大规模并发,通过MCP接入工具无需修改Harness。
- 轨迹重建:针对黑盒产生的碎片化调用,提出前缀树重建方法,合并重复历史,过滤无效分支(如Retry),生成完整训练轨迹。
- 多Harness联合训练:实现Mix-Harness Training,让单一策略模型同时从OpenClaw、ClaudeCode等异构Harness中学习。
实验结果:
- 在Qwen3-30B-A3B上,通过OpenClaw和ClaudeCode进行黑盒RL,分别使模型在PinchBench上提升了17.28和11.71分。
- 跨越JobBench和OfficeQA等不同形态任务,框架均能实现稳定提升,验证了通用性。
所属事件:人大发布 ClawGym II,黑盒 RL 直接训练复杂 Agent(3 条相关)→
「编程与Agent」频道最新
- 自动化平台Relay.app宣布关停:免费用户8月15日数据清零 — HaktanSuren · 2026-08-19
- RepoRelay:ChatGPT 安全读取本地代码库 — Lucaslogged · 2026-08-19
- Agent 驱动 Three.js 可视化,支持真实物理与交互 — doodlestein · 2026-08-19
- Volkern MCP Server:让 AI 智能体接管 CRM 客户管理 — modelcontextprotocol · 2026-08-19
- Gate Info MCP:用于加密货币发现与链上数据分析 — modelcontextprotocol · 2026-08-19
- 开源 OAuth 任务管理 MCP 服务器的工程实践 — Mean-Papaya3532 · 2026-08-19