人大发布 ClawGym II,黑盒 RL 直接训练复杂 Agent

中国人民大学高瓴人工智能学院发布 ClawGym II 论文,提出统一的黑盒强化学习框架,将执行与优化解耦:在模型边界设置服务代理,捕获 OpenClaw、Claude Code 等真实 Agent Harness 的工具调用,通过沙箱执行、轨迹重建与混合跨工具训练,对运行在复杂 Agent 框架上的通用智能体实现稳定、可扩展的直接训练。

2026-08-18 ~ 2026-08-19 · 3 条相关