Bespoke Labs 用 SFT+GRPO 把开源模型按代码库定制,提升 57 个百分点
heghbalz · x · 2026-09-04
Bespoke Labs 发布博客,演示如何把开源编码模型 Inkling 后训练到在特定 GitHub 仓库上表现更好,以 fontTools 仓库为例。
- 流程:用 SWE-Smith 技术从目标仓库生成任务,先用强教师模型轨迹做 SFT,再在仓库专属环境上做 GRPO 强化学习
- 效果:SFT 带来 held-out fontTools 评测 52 个百分点提升,加 RL 后总提升达 57pp
- 泛化:在 Terminal-Bench 2.1 和 SWE-Bench Lite 上与基座模型持平,且 token 效率提升最高 40%
- 作者称该方法是可复用的 blueprint,训练通过 Tinker API 完成
所属事件:Bespoke Labs 用 SFT+GRPO 后训练模型成单一代码仓库专家(4 条相关)→
「编程与Agent」频道最新
- Clanker Cloud 开放免费试用:注册即赠 20 美元额度 — tekbog · 2026-09-04
- Clanker Cloud 亮相:自建 Agent 一条龙,企业销售踩坑实录 — tekbog · 2026-09-04
- 像运营公司一样管 AI:Grok Bot 团队配项目经理分工协作 — FinanceYF5 · 2026-09-04
- AI 找漏洞比修漏洞快,工程师如何应对 CVE 积压 — _jaydeepkarale · 2026-09-04
- AAV 提出在意图与执行间加独立授权层治理 AI Agent — CarlosMarreroAAV · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04