华为与港中文推 Lego-RL,实现编码 Agent 强化训练

青稞AI · wechat · 2026-08-29

华为与香港中文大学联合发布 Lego-RL,这是一套面向 Coding Agent 的强化学习训练框架。其核心创新在于无需修改 Agent 原生 harness(如 OpenHands、ClaudeCode) 即可直接接入 RL 训练,解决了传统方法因改写控制流导致部署后性能退化的问题。

核心价值与数据:

三大技术特性:

架构设计:

框架基于 verl (训练) 和 Harbor (沙箱执行) 构建,中间通过 AgentLoopWorker 和 进程内 Proxy 桥接,适配器模式使得支持任何兼容 OpenAI/Anthropic 协议的 harness。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →