LoRA 合著者加入 Mercor,开源 397B RL 训练指南

himanshustwts · x · 2026-09-02

LoRA 和 muP 的联合发明人 Edward Hu(前 OpenAI)加入 Mercor 领导模型训练与研究。Mercor 发布了博文,详细介绍了如何使用 SkyRL 对 Qwen3.5-397B-A17B 进行后训练(RL)。该项目专注于利用专家数据提升知识工作代理能力,在 APEX-Agents 基准上,将 Pass@1 从 16.11% 提升至 27.29%(相对提升 70%)。文章开源了完整训练脚本、模型权重和评估轨迹。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →