RTX 5090 上仅花数千美元从零预训练 2B 模型
arXiv 新论文 Puro-2B 提出一套开源、低成本、消费级硬件可复现的 LLM 预训练方案。作者在单张 RTX 5090 上以 FP8 精度从零训练 2B 模型,处理 1.4T tokens,总成本不超过约 6900 美元,性能逼近 Qwen2.5-1.5B,展示了消费级 GPU 预训练大模型的可行性。
2026-08-28 ~ 2026-08-28 · 2 条相关
- RTX 5090 预训练 2B 模型仅耗 6900 美元,性能对标 Qwen2.5 — _reachsumit · 2026-08-28
- 清华团队用RTX 5090花$5090从零预训练2B模型,逼近Qwen2.5 — iScienceLuvr · 2026-08-28