LoRA一作Edward Hu入Mercor,RL把397B Agent基准Pass@1提升约70%

青稞AI · wechat · 2026-09-18

LoRA 第一作者、OpenAI o1 核心成员 Edward Hu 加入 Mercor 担任 Head of AI Modeling 后,与 UC 伯克利 SkyRL 团队联合发布面向复杂知识工作 Agent 的强化学习方案。第155期青稞社区直播(9月19日)将系统分享整套训练流程。核心成果:Qwen3.5-397B-A17B 在 APEX-Agents 上 Pass@1 从 16.11% 提升至 27.29%,相对提升约 70%;经 RL 后更小的 Qwen3.6-35B-A3B 也超过了 Claude Opus 4.5。

文章详细复盘:仅优化 Agent Harness 就把平均奖励提高 5.95 个百分点(22.74%→28.69%),约等于旧 Harness 上一个 epoch 的训练效果;通过 TITO 保证推理与训练 Token 完全一致,避免隐式 off-policy;采用全异步 RL 与动态微批提高长轨迹训练吞吐。文章还覆盖了环境稳定性治理(超时、Judge 限流、独立进程)、任务失败与系统错误的区分、Megatron 配置扫描、KVCache 限制下的并发上限(35B 550、397B 300)等工程细节。核心判断:对复杂知识工作 Agent,RL 算法只是训练系统的一部分,环境、Harness、Verifier 与调度同样决定成败。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →