Bittensor 团队用普通互联网连 5 数据中心训出 100B 模型
markjeffrey · x · 2026-09-25
- Macrocosmos 的 IOTA 项目(基于 Bittensor)完成一次去中心化分布式训练:跨 5 个数据中心、每节点单张 A100、通过普通互联网链路通信,训练 100B 参数模型。
- 成绩:平均 MFU 30.8%,峰值 38%,速度约为同任务在共址高带宽硬件上的 65%。据称这是已报道的分布式流水线并行训练中最高的 MFU。
- 两天跑了 11 亿 token 后因成本主动停止,核心目的是验证该规模模型在这类分散算力上能否稳定训练——结论是可以。
- IOTA 定位为「 disaggregated training」基础设施,把分散闲置算力整合为可用的训练容量,降低训练成本、盘活已有机队利用率。
「Infra」频道最新
- AI 能源公司 Parallax 出炉,获 Founders Fund 领投 1.17 亿美元 — graceisford · 2026-09-25
- Google 启动 Project Suncatcher:TPU 集群上太空组 ML 基础设施 — rseroter · 2026-09-25
- Nebius/WEKA 实测:分布式 KV cache 让单节点 agent 推理吞吐提升 2.4 倍 — AccBalanced · 2026-09-25
- Burkov AI 周报 #179:GPU 租买账、llm-d 低成本部署 753B 开源模型 — burkov · 2026-09-25
- 音乐模型 YuE2 完整版被压到 1.7GB 内存跑上 iPhone — Acceptable-Cycle4645 · 2026-09-25
- 微软 Fabric Efficient Scaledown 让 Shuffle 重型任务成本降 43% — adnan_hashmi · 2026-09-25