Bespoke Labs 用 SFT+GRPO 把模型后训练成代码仓库专家
AlexGDimakis · x · 2026-09-04
Bespoke Labs 与 Thinking Machines(John Schulman 团队提供支持)合作的新研究:如何把模型后训练成针对特定 GitHub 仓库个性化的编码模型。方法是以 Inkling 为基座,用强教师模型产生的轨迹做监督微调(SFT),再在专门策划的仓库级环境中用 GRPO 做强化学习,显著提升模型在该仓库上的表现。Alex Dimakis 致谢团队的工具与支持。
所属事件:Bespoke Labs 后训练让大模型变身代码仓库专家(2 条相关)→
「编程与Agent」频道最新
- xAI 详解 Grok Bot 设计:为持久化智能体重构交互界面 — soleio · 2026-09-04
- 开源 youtube-skills:让 AI 智能体获取 YouTube 字幕与视频搜索能力 — tom_doerr · 2026-09-04
- 免费本地模型 Muse Spark 1.3 惊艳开发者:又快又强 — HumungreousNobolatis · 2026-09-04
- Go 官方发布 Goroutine 泄漏分析器:生产可用、误报几乎为零 — rseroter · 2026-09-04
- Catch AI 亮相:99 美元行政助理,主动帮你省下 400 美元房费 — eyishazyer · 2026-09-04
- 事故响应 Agent 算账:1300 token 里编排仅占 50,单次成本可压到 0.001 美元 — kalyan_kpl · 2026-09-04