清华团队用RTX 5090花$5090从零预训练2B模型,逼近Qwen2.5

iScienceLuvr · x · 2026-08-28

arXiv 新论文 Puro-2B 展示了一套开源、低成本、消费级硬件可复现的 LLM 预训练方案。作者在 RTX 5090 上用 FP8 精度从零训练 1.4T tokens,总计 22,514 GPU 时、约 $6.9K 算力成本、17.6 天完成,最佳 checkpoint 超越 Qwen2-1.5B 并接近 Qwen2.5-1.5B。

论文指出小规模复现的成本壁垒:训练 Llama-3.2-3B 需超 $150 万,复现 SmolLM3-3B 需超 $70 万。降本靠硬件选型、低精度训练、超球优化、课程模型平均与数据配方。此外作者还拟合出「Puro 成本缩放律」,将训练成本与平均性能关联,覆盖数据配方、基础设施、软件栈与训练策略全部细节。

所属事件:RTX 5090 上仅花数千美元从零预训练 2B 模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →