LoRA 合著者加入 Mercor,开源 397B RL 训练指南
himanshustwts · x · 2026-09-02
LoRA 和 muP 的联合发明人 Edward Hu(前 OpenAI)加入 Mercor 领导模型训练与研究。Mercor 发布了博文,详细介绍了如何使用 SkyRL 对 Qwen3.5-397B-A17B 进行后训练(RL)。该项目专注于利用专家数据提升知识工作代理能力,在 APEX-Agents 基准上,将 Pass@1 从 16.11% 提升至 27.29%(相对提升 70%)。文章开源了完整训练脚本、模型权重和评估轨迹。
「编程与Agent」频道最新
- 为何 AI 写代码动辄十亿行?因 Agent 不懒且不限制工时 — intellectronica · 2026-09-02
- Civ6 MCP 实测:AI 智能体已能在 Deity 难度对战 — xeophon · 2026-09-02
- 开发者脚本实现多 Claude Max 账号无缝切换 — AaronBergman18 · 2026-09-02
- GitHub Copilot CLI v1.0.83-2 发布:支持多模型回退与代理 — copilot-cli-release-app[bot] · 2026-09-02
- JIT-Agent 论文:动态生成框架让小模型逆袭,成本降 36% — rohanpaul_ai · 2026-09-02
- LLM 语音输入陷阱:部分转录过早暴露意图导致误操作 — Mistaken_Wisdom · 2026-09-02