仅 500 条精选任务 GRPO 15 步,Qwen3.8-27B 提升 11.3 分

ycombinator · x · 2026-10-09

AI 训练数据公司 AfterQuery 分享了一项训练实验:仅从其 SWE agent 数据集中选取 500 条任务,内部后训练团队通过 15 步 GRPO 就让 Qwen3.8-27B-Medium 提升了 11.3 分,论证「编码数据并非生而平等」。

其联合创始人进一步阐述观点:早期就组建内部研究团队是公司最好的决策之一——知道什么是好数据只是及格线,真正的价值在于能向各家实验室展示其模型的 loss 在哪里,并提供数据去填补这些差距。

所属事件:仅 500 个任务微调,AfterQuery 让 Qwen 27B 提升 11.3 分(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →