RL 训练指南:Qwen 3.5 397B Pass@1 提升至 27.3%
mariofilhoml · x · 2026-09-02
Mercor Research 发布博文,详细分享了使用 DPPO 对 Qwen 3.5 397B 进行 RL 后训练的完整流程,旨在提升长周期知识工作的表现。在 APEX-Agents 基准上,模型 Pass@1 率从 16.11% 提升至 27.29%。文章重点介绍了常被忽视的基础设施建设和风险缓解工作,并公开了最终模型权重、完整训练脚本及评估轨迹。
「编程与Agent」频道最新
- MCP 架构实践:Grok Bot 坐镇 Superhuman — bfrench · 2026-09-02
- Qwen3.8-Max 夺 CodeArena 冠军,定价新高 — Alibaba_Qwen · 2026-09-02
- Agent 工程的本质是约束工程 — burny_tech · 2026-09-02
- 模型越聪明越爱过思考?开发者吐槽代码生成变慢 — sandyyevans · 2026-09-02
- InternReviewer 用强化学习提升同行评审准确性 — Shanghai-AI-Laboratory · 2026-09-02
- 控制流与数据流分离,防止提示词优化毁掉多智能体管线 — UWaterloo · 2026-09-02