Bespoke Labs 用 SFT+GRPO 后训练,代码仓库性能提升 57pp
AlexGDimakis · x · 2026-09-04
Bespoke Labs(Dimitris Dimakis 团队)发布新研究:如何把模型后训练成特定 GitHub 代码仓库的专家。
方法与结果:
- 基于 Inkling 基座模型,先用强教师模型的轨迹做监督微调(SFT),再在自建的仓库专属环境上做强化学习(GRPO)
- SFT 在 held-out 的 fontTools 评测集上带来 52pp 提升,加 RL 后总提升达 57pp
- 泛化性:后训练后的模型在 Terminal-Bench 2.1 和 SWE-Bench Lite 上同样表现良好
- 意外收获:token 效率提升 40%
- 致谢中提到 Thinking Machines Lab 的贡献,完整研究博客已发布
「编程与Agent」频道最新
- WebMCP 黑客松佳作:一个 URL 即可给 Agent 一台一次性电脑 — prd_008 · 2026-09-04
- Grok Bot 发 50 份 200 美元额度码,作者分享编排 bot 工作流 — omarsar0 · 2026-09-04
- 开发者用 Claude Max 五个月大幅改进 App Store Connect CLI — rudrank · 2026-09-04
- WHALE 提出:联合优化 LLM 权重与外挂 harness 的简单配方 — lateinteraction · 2026-09-04
- Apollo 发布实时编码 Agent 监视器 Watcher Live,可拦截危险操作 — MariusHobbhahn · 2026-09-04
- 顾问赴哈佛培训 Opportunity Insights 团队用 agentic coding — aniketapanjwani · 2026-09-04