RL 训练指南:Qwen 3.5 397B Pass@1 提升至 27.3%

mariofilhoml · x · 2026-09-02

Mercor Research 发布博文,详细分享了使用 DPPO 对 Qwen 3.5 397B 进行 RL 后训练的完整流程,旨在提升长周期知识工作的表现。在 APEX-Agents 基准上,模型 Pass@1 率从 16.11% 提升至 27.29%。文章重点介绍了常被忽视的基础设施建设和风险缓解工作,并公开了最终模型权重、完整训练脚本及评估轨迹。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →