poolside 讲解合成数据与严检如何训练 118B 代码模型
AI Engineer · youtube · 2026-07-25
poolside 用合成数据做代码预训练,做到了 118B 规模
Marah Abdin 和 Robert McHardy 介绍了 poolside 的代码数据与预训练流程:当高质量人类代码不够用后,团队开始大量合成数据,但重点不是“生成更多”,而是让样本足够难、足够像真实任务,真正能教会模型。
- 他们用模板加上下文生成代码样本,再通过改写措辞、调整难度,扩大任务分布但避免变成无脑题。
- 现有数据还会被多阶段改造成新形态,比如换角色/改剧情、把单轮提示扩成多轮对话。
- 每一条生成都会经过 orchestrator 审核,不符合目标的样本直接丢弃。
- 训练侧则是“零信任”:同一数据上跑两个副本,数值不一致就直接终止训练。
- 这种严格策略帮助他们发现了多种大规模故障,包括坏 GPU、张量并行里的精度问题,以及由竞态条件引起、但不会立刻报错的梯度污染。
- 团队称,这套 recipe 在扩展后依然稳定,最终训练出一个 118B 参数、面向 agentic coding 的模型,早期结果已经能压过 GLM 4.5 Air。
「编程与Agent」频道最新
- 改造 orchestration skill,让多个 agent 互相自我审查 — pvncher · 2026-07-27
- 现代 AI Agent 协议栈的 11 项实用地图 — TheTuringPost · 2026-07-27
- Qwen Code nightly 加入 Goal v3 编排和工作区通道管理 — qwen-code-ci-bot · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 东京 Agent Forge 黑客松一天做出可上线 AI agents — DavidBennett__ · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27