约 2000 美元训练 Apex-2:双 GH200 + DiLoCo 与 57% 重复数据的教训
Prestigious-Taste-63 · reddit · 2026-10-05
独立开发者复盘从零训练模型 Apex-2 的经验,总成本约 2,000 美元:
- GPU 是最大瓶颈:原计划训 1T tokens,实际只训了约 80B。单张 H100 远不够,FineWeb-Edu 一个数据集就有约 1.3T tokens。
- DiLoCo 分布式方案:不用 2x H100 实例(约 $4.19/卡/时),改用两个 GH200 实例($2.29/卡/时),各自达到约 40% MFU,每 350 步合并一次模型(合并通常不到一分钟),训练速度约为单卡的 1.9 倍且更便宜。
- 跨快照去重:用 MinHash 对全语料去重后发现 FineWeb-Edu 样本 57%、DCLM 34% 是重复——FineWeb-Edu 只在单个 Common Crawl 快照内去重。作者也注明 FineWeb 作者报告跨快照去重并未提升效果,属于取舍而非免费收益。
- 架构:MoE 部分遵循 Mixtral 论文。
作者正在训练 21B 参数的 MoE 模型,并表示希望加入实验室继续做 LLM。
「Infra」频道最新
- 单颗 SpaceX Starmind 卫星太阳能功率将超整个国际空间站 — XFreeze · 2026-10-05
- SEA 算力扩张:GPU 到货快于机房,缺的是土地电力与运营层 — vincent_koc · 2026-10-05
- 爆料称 SPCX 也在自研光纤,垂直整合再下一城 — Kyrannio · 2026-10-05
- llama.cpp 新 Metal 内核合并,Mac 投机解码提速 3.4 倍至 110 tok/s — ggerganov · 2026-10-05
- 端侧语音识别模型 Whistle 登上 Hugging Face 热榜 — Cactus-Compute · 2026-10-05
- AI 需求外溢,测试测量设备交货期最长达一年 — zephyr_z9 · 2026-10-05