仅用 4400 美元在 RTX 5090 上从头训练 2B 模型
burny_tech · x · 2026-08-31
这篇论文提出了一套针对消费级 GPU(RTX 5090)的全栈低成本预训练方案。通过结合 Blockwise FP8、MuonH 优化器和课程模型平均等技术,研究团队在 1.4 万亿 Token 上以 FP8 精度训练了 Puro-2B 模型。
核心结论:
- 成本控制: 最佳模型计算成本低于 6900 美元,根据推导的成本缩放定律,仅需约 4400 美元即可达到 Qwen2-1.5B 级别的性能。
- 性能对标: 模型性能接近 Qwen2.5-1.5B。
- 技术栈: 证明了通过软硬件协同设计,小实验室也能承担 LLM 预训练成本。
所属事件:清华团队5090美元在RTX 5090上复刻Qwen级模型(4 条相关)→
「Infra」频道最新
- 双 RTX 6000 搭建本地开发环境,选什么模型好? — alexp702 · 2026-08-31
- NVIDIA 被指为垄断本地 AI 之路放弃玩家市场 — jonejy · 2026-08-31
- 实测 ROCm 10 驱动双 R9 7900 跑 Qwen 27B 性能提升 10% — hurdurdur7 · 2026-08-31
- Qdrant 推出 SQL 风格查询语言 QQL,大幅简化向量检索 — qdrant_engine · 2026-08-31
- Wasmer 推出一键部署功能,支持 GitHub 导入 — jedisct1 · 2026-08-31
- 实测 API 调用成本:Token 价格非唯一指标,重试费与计费模式更关键 — Few-Market-6535 · 2026-08-31