180张消费级显卡混训:50B token任务中断百次仅增2%成本
bittingthembits · x · 2026-08-07
MacrocosmosAI 团队的 IOTA SN9 项目展示了在高度不稳定环境下的分布式训练能力。该实验将 180 多张 RTX 4090/5090 显卡混合组网,在普通互联网环境下进行训练。
- 性能表现:在成本大幅降低的前提下,仍能达到等效数据中心 65% 的速度。
- 容错能力:在 500 亿 token 的训练任务中,即使发生 100 次节点中断或离开,也仅增加 2% 的额外 token 成本。
- 技术原理:通过压缩和减少 GPU 间需要传输的数据量,让不可靠的全球分散算力表现得像一个可靠的 AI 数据中心。
「Infra」频道最新
- SpaceX 新数据中心自带天然气电厂与储能阵列 — BenBajarin · 2026-08-07
- 单卡RTX 3090跑3分钟AI音乐视频,MiniMax T2V本地实测 — Inevitable_Emu2722 · 2026-08-07
- 美 38% 人口住在数据中心 5 英里内,算力基建近在咫尺 — neil_chilson · 2026-08-07
- Forge Neo 实用插件推荐:秒转 Int8 且画质几乎无损 — cradledust · 2026-08-07
- AI Agent推理成本骤降:烧一个月竟比买份卷饼还便宜 — intellectronica · 2026-08-07
- 推测解码技术将改变大模型 API 训练条款 — charles_irl · 2026-08-07