清华团队5090美元在RTX 5090上复刻Qwen级模型
清华 PACMAN 团队发布完全开源的预训练配方 Puro-2B(基于 Qwen2-1.5B 架构,自称 "Poor Lab's"),在单块 RTX 5090 上以低于 5090 美元的成本即可从头训练出达到 Qwen2-1.5B 水平的 2B 模型;投入约 6900 美元则性能接近更强模型。方案结合 Blockwise FP8、MuonH 优化器和课程模型平均等技术,在 1.4 万亿 token 上完成训练,旨在降低大模型预训练门槛。
2026-08-31 ~ 2026-08-31 · 4 条相关
- 第 1 集:RTX 5090 上仅花数千美元从零预训练 2B 模型(2026-08-28,2 条)
- 第 2 集:清华团队5090美元在RTX 5090上复刻Qwen级模型(2026-08-31,4 条)
- 仅用 4400 美元在 RTX 5090 上从头训练 2B 模型 — burny_tech · 2026-08-31
- Puro-2B 发布:RTX 5090 耗资不足 $5090 复刻 Qwen — burny_tech · 2026-08-31
- 仅需 $5090 在 RTX 5090 训练 Qwen 级模型 — zhaoran_wang · 2026-08-31
- 不到 7 千美元:清华团队在 RTX 5090 上预训练 2B 模型 — thu-pacman · 2026-08-31