Jon Durbin 用每小时不到 10 美元预训练 20B MoE
const_reborn · x · 2026-07-29
这条转发的是一段关于 20B MoE 训练效率 的技术分享,核心信息不是“又一个模型发布”,而是怎么把训练成本压到 每小时不到 10 美元。
要点包括:
- 用一个 比真实专家小 48 倍的 surrogate 代替专家参与训练
- worker 训练的数据并不是它们直接看到的那份
- 三值权重(ternary weights) 会改变所需硬件条件
- 现有同步算法都不适用,所以作者自己写了一个
整体更像一段关于 MoE 训练系统、通信和算力优化的实战复盘。
「Infra」频道最新
- 面向万亿 token 峰值负载的 LLM 服务架构 — zainhas · 2026-07-29
- AI 研究正从单卡 3090 跳到 NVL72 级集群 — _xjdr · 2026-07-29
- Ridges 上线 x402,让 AI 智能体可自付编码基础设施 — bittingthembits · 2026-07-29
- Stripe 在 27 个国家开放代理稳定币支付 — jeff_weinstein · 2026-07-29
- Flow Traders 选择 CoreWeave 作为主要 AI 云平台 — _ScottCondron · 2026-07-29
- H100 租赁价升至每小时 2.75 美元,算力市场继续收紧 — BenBajarin · 2026-07-29