Project Orion 在三大洲异构算力上直播训练 16B 模型
markjeffrey · x · 2026-07-28
Project Orion 继续推进其实时分布式训练实验,重点放在异构算力和更长周期的训练上。
- 当前使用的是 4090 和 5090,后续还会加入 A6000、A100 等不同形态和规模的节点。
- 团队正把更多 provider 接入,通过 Bittensor 原生算力、经子网路由来扩展系统。
- 目前跑出的峰值 MFU 为 40%,团队希望通过调参收敛到约 30%。
- 下一阶段会做更长时间的训练,继续观察 DiLoCo 动力学、ResBM 在更大规模下的效果,以及 liquid compute 的可中断实验。
- 被引公告称,Orion-16B 正在跨三大洲、在去中心化且异构的基础设施上实时训练,且没有单一实体拥有它。
所属事件:Orion-16B 跨三大洲去中心化训练跑通(5 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23