poolside 讲解合成数据与严检如何训练 118B 代码模型
AI Engineer · youtube · 2026-07-25
poolside 用合成数据做代码预训练,做到了 118B 规模
Marah Abdin 和 Robert McHardy 介绍了 poolside 的代码数据与预训练流程:当高质量人类代码不够用后,团队开始大量合成数据,但重点不是“生成更多”,而是让样本足够难、足够像真实任务,真正能教会模型。
- 他们用模板加上下文生成代码样本,再通过改写措辞、调整难度,扩大任务分布但避免变成无脑题。
- 现有数据还会被多阶段改造成新形态,比如换角色/改剧情、把单轮提示扩成多轮对话。
- 每一条生成都会经过 orchestrator 审核,不符合目标的样本直接丢弃。
- 训练侧则是“零信任”:同一数据上跑两个副本,数值不一致就直接终止训练。
- 这种严格策略帮助他们发现了多种大规模故障,包括坏 GPU、张量并行里的精度问题,以及由竞态条件引起、但不会立刻报错的梯度污染。
- 团队称,这套 recipe 在扩展后依然稳定,最终训练出一个 118B 参数、面向 agentic coding 的模型,早期结果已经能压过 GLM 4.5 Air。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11