Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen
cs.CL, cs.LG
2026-08-28
清华用消费级显卡从零训练约二十亿参数、一点四万亿 token 的模型,复现算力费六千八百九十美元,十五项均分超过 Qwen2,距 Qwen2.5 仍差约三分。
开源权重已经很多,真正能复现的预训练配方仍贵。按这篇的租卡折算,Llama-3.2-3B 超过 150 万美元,SmolLM3-3B 约 72 万美元,OLMoE-1B-7B 约 20 万美元。配方公开不等于小实验室跑得起。
清华 PACMAN 组和鹏城实验室给出一套面向「穷实验室」的从零预训练配方,在消费级 RTX 5090 上训一组约 2B 的 PuRo-2B(普罗-2B)。对照锚点是 Qwen2-1.5B 和 Qwen2.5-1.5B。权重、数据清单、Megatron 训练代码和 Kaiyuan-Spark 数据处理按 Apache 2.0 放出,上游数据许可证另算。
骨架跟 Qwen3-1.7B 接近,但解开 embedding 和 LM head 的绑定,总参数到约 2B。序列长 4096,全局 batch 1536。两阶段:Phase 1 用 24 张卡吃 438.8B token,Phase 2 扩到 96 张卡再吃 960B,合计约 1.4T。
省钱叠了五层,而且互相咬合。
并行不用张量并行,Phase 1 是 PP=2、DP=12,混合精度 MFU 约 73%。
费用口径只含最终两阶段的加速卡时,不含洗数据、代理实验、失败重跑、后训练和人工。规范 run 22514 卡时、6890 美元;只做到匹配 Qwen2 的均匀数据变体 14262 卡时、4370 美元。
15 项未加权均分:PuRo-2B 57.81,Qwen2-1.5B 55.14,Qwen2.5-1.5B 60.73。Qwen 两侧的美元数字是按 6ND 和 H100 等价估出来的(约 8.4 万和 21.7 万),和这边实测 5090 卡时不是同一类账单。
| 模型 | GSM8K | MATH | HumanEval | MMLU | 15 项均分 |
| Qwen2-1.5B | 59.82 | 23.70 | 27.44 | 56.39 | 55.14 |
| PuRo-2B($4.4K) | 56.03 | 27.86 | 20.73 | 54.82 | 55.54 |
| PuRo-2B | 59.67 | 30.30 | 31.10 | 57.44 | 57.81 |
| Qwen2.5-1.5B | 67.70 | 32.28 | 31.71 | 61.56 | 60.73 |
数学+代码四项均分 43.50,比 Qwen2 高 3.21,比 Qwen2.5 低 4.02;推理知识十一项 63.02,比 Qwen2 高 2.48,比 Qwen2.5 低 2.51。同协议下仍落后 SmolLM3-3B(65.85)和 Qwen3-1.7B-Base(65.27),那两家的估计复现成本高一到两个数量级。
课程相对均匀排序,15 项大约高 1.2 到 1.6 分。后训练之后差距还在:专注数学 SFT 的 GSM8K 68.66 对 66.89,放大数学配方 76.12 对 74.10,宽指令 15 项 56.58 对 54.99。
拟合出的 Puro Cost Scaling Law 是固定 2B、本配方的缩小曲线,反推约 4400 美元可跨过 Qwen2 均分。
对真正想从零做预训练实验的小团队,这是目前少有的「消费卡 + 万亿 token + 公开配方 + 把美元写清楚」的完整例子。5090 的算力/美元是真的,但要吃到他们报的吞吐,往往得改驱动、调流水线切分,还得接受 32GB 显存。
「逼近 Qwen2.5」说的是同一套 15 项协议下差约 3 分,不是全面追平。标题里的 $5090 是在说:按他们的缩小律,打到 Qwen2-1.5B 可以压进这个数。
费用是边际加速卡费,不是把实验室搭起来的总成本。对照模型很多用 6ND 估,横轴不好直接当报价单。训练语料大多来自已经过滤过的开源集,没有对全部评测集做严格去污染审计,课程优势里可能掺了一部分泄漏;作者用后训练后优势仍在来辩护,但审计还没做。中文占了配比,却故意不进主表。700 token/参数是过训练的小模型,不是算力最优,缩放律也不能外推到更大模型。32GB 和缺 NVLink 会在放大模型时先撞墙。