清华用消费级 5090 花 6890 美元从零训 2B,15 项均分超过 Qwen2

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen

cs.CL, cs.LG

2026-08-28

清华用消费级显卡从零训练约二十亿参数、一点四万亿 token 的模型,复现算力费六千八百九十美元,十五项均分超过 Qwen2,距 Qwen2.5 仍差约三分。

这篇在解决什么

开源权重已经很多,真正能复现的预训练配方仍贵。按这篇的租卡折算,Llama-3.2-3B 超过 150 万美元,SmolLM3-3B 约 72 万美元,OLMoE-1B-7B 约 20 万美元。配方公开不等于小实验室跑得起。

清华 PACMAN 组和鹏城实验室给出一套面向「穷实验室」的从零预训练配方,在消费级 RTX 5090 上训一组约 2B 的 PuRo-2B(普罗-2B)。对照锚点是 Qwen2-1.5B 和 Qwen2.5-1.5B。权重、数据清单、Megatron 训练代码和 Kaiyuan-Spark 数据处理按 Apache 2.0 放出,上游数据许可证另算。

方法

骨架跟 Qwen3-1.7B 接近,但解开 embedding 和 LM head 的绑定,总参数到约 2B。序列长 4096,全局 batch 1536。两阶段:Phase 1 用 24 张卡吃 438.8B token,Phase 2 扩到 96 张卡再吃 960B,合计约 1.4T。

省钱叠了五层,而且互相咬合。

并行不用张量并行,Phase 1 是 PP=2、DP=12,混合精度 MFU 约 73%。

结果

费用口径只含最终两阶段的加速卡时,不含洗数据、代理实验、失败重跑、后训练和人工。规范 run 22514 卡时、6890 美元;只做到匹配 Qwen2 的均匀数据变体 14262 卡时、4370 美元。

15 项未加权均分:PuRo-2B 57.81,Qwen2-1.5B 55.14,Qwen2.5-1.5B 60.73。Qwen 两侧的美元数字是按 6ND 和 H100 等价估出来的(约 8.4 万和 21.7 万),和这边实测 5090 卡时不是同一类账单。

模型GSM8KMATHHumanEvalMMLU15 项均分
Qwen2-1.5B59.8223.7027.4456.3955.14
PuRo-2B($4.4K)56.0327.8620.7354.8255.54
PuRo-2B59.6730.3031.1057.4457.81
Qwen2.5-1.5B67.7032.2831.7161.5660.73

数学+代码四项均分 43.50,比 Qwen2 高 3.21,比 Qwen2.5 低 4.02;推理知识十一项 63.02,比 Qwen2 高 2.48,比 Qwen2.5 低 2.51。同协议下仍落后 SmolLM3-3B(65.85)和 Qwen3-1.7B-Base(65.27),那两家的估计复现成本高一到两个数量级。

课程相对均匀排序,15 项大约高 1.2 到 1.6 分。后训练之后差距还在:专注数学 SFT 的 GSM8K 68.66 对 66.89,放大数学配方 76.12 对 74.10,宽指令 15 项 56.58 对 54.99。

拟合出的 Puro Cost Scaling Law 是固定 2B、本配方的缩小曲线,反推约 4400 美元可跨过 Qwen2 均分。

为什么重要

对真正想从零做预训练实验的小团队,这是目前少有的「消费卡 + 万亿 token + 公开配方 + 把美元写清楚」的完整例子。5090 的算力/美元是真的,但要吃到他们报的吞吐,往往得改驱动、调流水线切分,还得接受 32GB 显存。

「逼近 Qwen2.5」说的是同一套 15 项协议下差约 3 分,不是全面追平。标题里的 $5090 是在说:按他们的缩小律,打到 Qwen2-1.5B 可以压进这个数。

局限与存疑

费用是边际加速卡费,不是把实验室搭起来的总成本。对照模型很多用 6ND 估,横轴不好直接当报价单。训练语料大多来自已经过滤过的开源集,没有对全部评测集做严格去污染审计,课程优势里可能掺了一部分泄漏;作者用后训练后优势仍在来辩护,但审计还没做。中文占了配比,却故意不进主表。700 token/参数是过训练的小模型,不是算力最优,缩放律也不能外推到更大模型。32GB 和缺 NVLink 会在放大模型时先撞墙。

术语

原文与代码

社区讨论

相关论文

全部论文解读