清华团队5090美元在RTX 5090上复刻Qwen级模型

清华 PACMAN 团队发布完全开源的预训练配方 Puro-2B(基于 Qwen2-1.5B 架构,自称 "Poor Lab's"),在单块 RTX 5090 上以低于 5090 美元的成本即可从头训练出达到 Qwen2-1.5B 水平的 2B 模型;投入约 6900 美元则性能接近更强模型。方案结合 Blockwise FP8、MuonH 优化器和课程模型平均等技术,在 1.4 万亿 token 上完成训练,旨在降低大模型预训练门槛。

2026-08-31 ~ 2026-08-31 · 4 条相关

事件全程(共 2 集)→