Google Cloud 用 TPU 复现 Olmo 3 7B 训练,保留集评测全部对齐
allen_ai · x · 2026-09-29
Google Cloud 团队在开发者博客发布案例研究,用 MaxText 在 Cloud TPU 上从零复现 Ai2 的 Olmo 3 7B,覆盖 stage-1 预训练和 stage-2 mid-training 退火,并在保留集评测(而不仅是 loss 曲线)上与原训练对齐。
关键细节:
- PyTorch→JAX 转换验证:Olmo 3 的架构(reordered-norm、QK-norm、3:1 sliding/global attention)移植到 MaxText 后,转换后 step-0 检查点与 HuggingFace 参考的 KL 散度约 1.5e-3;8192 token 上下文 bfloat16 下 top-1 token 一致率 98.75%。
- 验证机制抓到真 bug:保留集评测发现一个 data-loader bug 让 MaxText 看似超越参考——实际增益来自数据记忆。
- 团队选择 Olmo 3 是因为其完全开放:数据、代码、配置、checkpoint、日志与评测全公开,并提供独立 PyTorch/GPU 参照。
这既验证了 MaxText+TPU 大规模训练的可靠性,也展示了完全开放模型对可复现性研究的价值。
「Infra」频道最新
- Celesto 推 GitHub Actions 托管 runner,称比官方便宜 12 倍 — aniketmaurya · 2026-09-30
- Wasmer 发布 Pi:浏览器和 iPhone 上原生运行 AI agent — JosephJacks_ · 2026-09-30
- 高通 Kondap 谈 X2 Elite:Surface 新品、Googlebook 与 Linux 生态 — ryanshrout · 2026-09-30
- 书级长文从第一性原理讲透虚拟内存:页表、TLB 与 NUMA 性能 — abhi9u · 2026-09-30
- Swift 1.5 比 Qwen3.8 27B 少写三成 token,M5 Max 跑 34.8 tok/s — DerTomsn · 2026-09-30
- Anthropic 与 SpaceX 达成最高 845 亿美元算力协议 — XFreeze · 2026-09-30