Bespoke Labs 用 SFT+GRPO 把模型后训练成代码仓库专家

AlexGDimakis · x · 2026-09-04

Bespoke Labs 与 Thinking Machines(John Schulman 团队提供支持)合作的新研究:如何把模型后训练成针对特定 GitHub 仓库个性化的编码模型。方法是以 Inkling 为基座,用强教师模型产生的轨迹做监督微调(SFT),再在专门策划的仓库级环境中用 GRPO 做强化学习,显著提升模型在该仓库上的表现。Alex Dimakis 致谢团队的工具与支持。

所属事件:Bespoke Labs 后训练让大模型变身代码仓库专家(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →