20B MoE预训练竟低于每小时10美元
const_reborn · x · 2026-07-20
帖中转述了 @jondurbin 的做法:一个 20B MoE 模型的预训练,算力成本做到 每小时不到 10 美元。
这不是在集群上完成的,而是通过 8 台分布在两个大洲的单卡 L40S 服务器,再加上几张 4090 和一张 5090 来跑;代价是每步大约 6 秒。这条信息的重点在于:原本被认为必须依赖大规模集中式集群的预训练,竟然可以用非常分散、低成本的方式完成。
「Infra」频道最新
- Weaviate 增加按查询剖析,定位慢搜索到底卡在哪一步 — CShorten30 · 2026-07-22
- Mistral 扩大与微软合作,并在欧洲增加 AI 算力 — MistralAI · 2026-07-22
- 视频生成最高提速5倍,Sol-Engine发布免训练稀疏注意力 — songhan_mit · 2026-07-22
- PyTorch CTO 将探讨开源 AI 推理经济与工作流优化 — PyTorch · 2026-07-22
- 发烧友用 1.5 万美元把 GLM-5.2 跑到接近无损 — amplifiedamp · 2026-07-21
- AI 加速器已占北美在运数据中心电力的 15% 到 20% — BenBajarin · 2026-07-21