Orion 16B 突破 1000 亿训练 Token,利用 DPP 分布式算力
markjeffrey · x · 2026-08-18
- 训练里程碑:Orion 16B 模型训练 Token 数突破 1000 亿,且性能仍在提升。
- 技术架构:这是目前最大的使用 DPP(确定性点积?注:原文未详述 DPP 全称,保留缩写)进行预训练的大模型。
- 算力规模:已达到 $10^{22}$ FLOPS,使用来自全球无许可分布式提供商的异构商品 GPU。
- 未来计划:计划下周增加新的 GPU 类型,将数量提升至 256 张,并进一步优化吞吐量。
「Infra」频道最新
- SGLang 更新 Qwen3.8-27B 配方,RTX 5090 跑出 206 tok/s — ying11231 · 2026-08-18
- Rerank 反直觉现象:文档过多效果反降 — CShorten30 · 2026-08-18
- Qwen 3.8 27B 本地部署指南:3090 上的最佳参数 — cezarducatti · 2026-08-18
- Netlify 推出自托管 Git 平台:速度显著超 GitHub — thisiskp_ · 2026-08-18
- 传谷歌拟千万美元收购 Spirit 全量运营数据 — soumitrashukla9 · 2026-08-18
- 减少内存搬运:AI 基础设施优化的四个核心方向 — prateekj · 2026-08-18