仅用 4400 美元在 RTX 5090 上从头训练 2B 模型

burny_tech · x · 2026-08-31

这篇论文提出了一套针对消费级 GPU(RTX 5090)的全栈低成本预训练方案。通过结合 Blockwise FP8、MuonH 优化器和课程模型平均等技术,研究团队在 1.4 万亿 Token 上以 FP8 精度训练了 Puro-2B 模型。

核心结论:

所属事件:清华团队5090美元在RTX 5090上复刻Qwen级模型(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →