仅 500 条精选任务 GRPO 15 步,Qwen3.8-27B 提升 11.3 分
ycombinator · x · 2026-10-09
AI 训练数据公司 AfterQuery 分享了一项训练实验:仅从其 SWE agent 数据集中选取 500 条任务,内部后训练团队通过 15 步 GRPO 就让 Qwen3.8-27B-Medium 提升了 11.3 分,论证「编码数据并非生而平等」。
其联合创始人进一步阐述观点:早期就组建内部研究团队是公司最好的决策之一——知道什么是好数据只是及格线,真正的价值在于能向各家实验室展示其模型的 loss 在哪里,并提供数据去填补这些差距。
所属事件:仅 500 个任务微调,AfterQuery 让 Qwen 27B 提升 11.3 分(2 条相关)→
「编程与Agent」频道最新
- LLM-as-a-Verifier 开源:弱模型验证强模型,Terminal-Bench 达 69.2% SOTA — Azaliamirh · 2026-10-09
- Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6% — Salesforce · 2026-10-09
- 实测 AI Agent 网站准入难:16 个 subreddit 已封 7 个 — lulzxdxdxd · 2026-10-09
- Prompt tuning 被集体遗忘,微调 token 或被严重低估 — cephaloform · 2026-10-09
- 架构师分享:用 WhatsApp 语音搭建个人 AI 管家 — No_Kangaroo_4454 · 2026-10-09
- AI 工作台密集上新:多人协作、交互仪表盘、记忆与技能 — heyneighbor · 2026-10-09