Pluralis-8B decentralized training run: 98 consumer-GPU nodes at ~$11 per billion tokens

jon_durbin · x · 2026-09-11

jondurbin shares the Pluralis-8B decentralized training run: a dense 8.6B model (vs. comparable MoE setups) trained on 98 contributor nodes of consumer 4090/5090 GPUs over FineWeb-Edu 1.3T, at roughly $11 per billion tokens. A public Agora dashboard exposes telemetry, MFU, and per-node splits — a rare open experiment in consumer-GPU swarm training.

Related event: Dev Showcases Decentralized Training at ~$11 per Billion Tokens, Open-Sources 1T-Token Dataset(5 posts)→

Original post →

More from Infra

Infra channel →