华为与港中文推 Lego-RL,实现编码 Agent 强化训练
青稞AI · wechat · 2026-08-29
华为与香港中文大学联合发布 Lego-RL,这是一套面向 Coding Agent 的强化学习训练框架。其核心创新在于无需修改 Agent 原生 harness(如 OpenHands、ClaudeCode) 即可直接接入 RL 训练,解决了传统方法因改写控制流导致部署后性能退化的问题。
核心价值与数据:
- 在 SWE-bench Verified 上,基于 Qwen2.5-35B-A3B,将 OpenHands/ClaudeCode/OpenCode 三大 harness 的分数分别从 64.0/62.4/57.2 提升至 70.4/68.2/66.6,收益显著超过直接升级至 Qwen3.6 Base 模型。
- 揭示了 Harness 带来的性能差异接近 7 分,证明了 RL 训练必须在部署时使用的真实 harness 上进行。
三大技术特性:
- Faithful (保真优化):通过进程内 Proxy 和 R3 (Rollout Routing Replay) 解决了 harness 运行时改写历史导致 token 对齐不准及 MoE 路由偏差的问题,将训练/推理相关性提升至 0.9993。
- Reliable (可靠执行):沙箱化执行环境,内置反作弊防护,按任务难度筛选,并将 Infra 故障导致的轨迹终止正确处理,确保 Reward 信号可信。
- Observable (可观测训练):提供 AgentPlugin 和 LiveUI,能够实时诊断 Reward 波动是源于策略退化还是环境故障,解决了 RL 调参黑盒难题。
架构设计:
框架基于 verl (训练) 和 Harbor (沙箱执行) 构建,中间通过 AgentLoopWorker 和 进程内 Proxy 桥接,适配器模式使得支持任何兼容 OpenAI/Anthropic 协议的 harness。
「编程与Agent」频道最新
- 韩语开发者吐槽:无法验证 AI 产出是否合格才是真问题 — algo_diver · 2026-09-23
- 开发者的算账:100 次 eval 只花 20 美元,说明题目太简单 — pvncher · 2026-09-23
- 烧光 3 次重置再加 Claude x20,玩家用 AI 把双屏设备刷进 Android 17 — PaddleStroke · 2026-09-23
- 用 AI 复刻 2019 年构想的游戏,做完发现点子没想象中好 — BLUECOW009 · 2026-09-23
- 开源 Agent Message Board:让并行编码智能体共用留言板协作 — airesearch12 · 2026-09-23
- 从业者断言:好评测的保质期只有三个月 — pvncher · 2026-09-23