开发者晒去中心化训练成果:1T token数据集开源,成本约$11/十亿token
开发者 jondurbin 于 9 月 11 日集中分享了一次去中心化模型训练 run 的完整成果:成本约 $11/b tokens(每十亿 token 约 11 美元),MFU(模型算力利用率)极高,他本人称这一成本与利用率「insane」,整体表现「pretty legendary」。
已确认
- 训练项目为 Pluralis-8B:去中心化训练,使用 98 个节点的消费级 GPU(RTX 4090/5090)组网;配置与另一同基础设施、同 tokenizer、同 1.3T FineWeb 数据集的项目类似,Pluralis-8B 为对比对象之一。
- 训练成本约 $11/b tokens,jondurbin 搭建了带监控功能的训练 dashboard 展示运行可见性数据,MFU 表现出色。
- 公开(开源)了预训练数据集 chutesai/mesh-1t-prod-mix:约 1 万亿 token 的多阶段预训练语料,纯预训练、不含 SFT/RL,已在 Hugging Face 以 gated+自动审批方式发布。
- 另分享 8 张 RTX 5090 组成的集群做分布式训练的实测数据,同样实现约 $11/b tokens 的成本与高 MFU;选择 5090 的原因与长时间高负载场景有关,但他同时指出 GPU 稳定性存在隐忧。
- 技术细节:GPU 节点需同时承担带宽负载(训练与推理流量叠加),作者称推理方面同样表现出色。
为什么重要
- 这一组合(消费级 GPU + 去中心化组网 + 开源数据集 + 公开成本/MFU 数据)为低成本开源预训练提供了可复现的完整参考:数据、监控方法与硬件选型全部公开。
- 约 $11/十亿 token 的成本与高 MFU 表明,去中心化消费级硬件路线在中小规模预训练上已具备实用可行性,但 GPU 长时间高负载的稳定性问题仍是该路线的现实约束。
2026-09-11 ~ 2026-09-11 · 5 条相关
一手来源
- 去中心化训练 Pluralis-8B:98 节点消费级 GPU,约 11 美元/十亿 token — jon_durbin ·
- 开发者开源 1T token 预训练数据集,成本仅约 11 美元/十亿 token — jon_durbin ·
- 8卡5090集群跑训练:约11美元/十亿token,GPU稳定性堪忧 — jon_durbin ·
- 开发者晒训练仪表盘:成本约 $11/百万 token,MFU 高得离谱 — jon_durbin · 2026-09-11
- 【源头】8卡5090集群跑训练:约11美元/十亿token,GPU稳定性堪忧 — jon_durbin · 2026-09-11
- 【源头】开发者开源 1T token 预训练数据集,成本仅约 11 美元/十亿 token — jon_durbin · 2026-09-11
- 【源头】去中心化训练 Pluralis-8B:98 节点消费级 GPU,约 11 美元/十亿 token — jon_durbin · 2026-09-11
- 成本约 $11/b tokens、MFU 惊人:某训练运行细节曝光 — jon_durbin · 2026-09-11