LoRA一作Edward Hu入Mercor,RL把397B Agent基准Pass@1提升约70%
青稞AI · wechat · 2026-09-18
LoRA 第一作者、OpenAI o1 核心成员 Edward Hu 加入 Mercor 担任 Head of AI Modeling 后,与 UC 伯克利 SkyRL 团队联合发布面向复杂知识工作 Agent 的强化学习方案。第155期青稞社区直播(9月19日)将系统分享整套训练流程。核心成果:Qwen3.5-397B-A17B 在 APEX-Agents 上 Pass@1 从 16.11% 提升至 27.29%,相对提升约 70%;经 RL 后更小的 Qwen3.6-35B-A3B 也超过了 Claude Opus 4.5。
文章详细复盘:仅优化 Agent Harness 就把平均奖励提高 5.95 个百分点(22.74%→28.69%),约等于旧 Harness 上一个 epoch 的训练效果;通过 TITO 保证推理与训练 Token 完全一致,避免隐式 off-policy;采用全异步 RL 与动态微批提高长轨迹训练吞吐。文章还覆盖了环境稳定性治理(超时、Judge 限流、独立进程)、任务失败与系统错误的区分、Megatron 配置扫描、KVCache 限制下的并发上限(35B 550、397B 300)等工程细节。核心判断:对复杂知识工作 Agent,RL 算法只是训练系统的一部分,环境、Harness、Verifier 与调度同样决定成败。
「编程与Agent」频道最新
- LangGraph 用 Jev 做廉价分类器,为 Agent 流程引入更多控制原语 — hwchase17 · 2026-09-18
- Claude Code 2.1.276 更新明细:距上版不到 6 小时,提示词增 440 token — ClaudeCodeLog · 2026-09-18
- Claude Code 2.1.276 发布:修复代理网关下全部请求 400 的回归 — ClaudeCodeLog · 2026-09-18
- Claude Code 2.1.276 发布:修复代理网关下全部请求 400 的回归 — ClaudeCodeLog · 2026-09-18
- Layers 跑通首个自主闭环:Detail 提修 PR,Devin 审查,Claude 终审 — saranormous · 2026-09-18
- 用 Gradio 把 4B 小模型微调成答案打分器,温度缩放校准置信度 — Gradio · 2026-09-18