清华团队用RTX 5090花$5090从零预训练2B模型,逼近Qwen2.5
iScienceLuvr · x · 2026-08-28
arXiv 新论文 Puro-2B 展示了一套开源、低成本、消费级硬件可复现的 LLM 预训练方案。作者在 RTX 5090 上用 FP8 精度从零训练 1.4T tokens,总计 22,514 GPU 时、约 $6.9K 算力成本、17.6 天完成,最佳 checkpoint 超越 Qwen2-1.5B 并接近 Qwen2.5-1.5B。
论文指出小规模复现的成本壁垒:训练 Llama-3.2-3B 需超 $150 万,复现 SmolLM3-3B 需超 $70 万。降本靠硬件选型、低精度训练、超球优化、课程模型平均与数据配方。此外作者还拟合出「Puro 成本缩放律」,将训练成本与平均性能关联,覆盖数据配方、基础设施、软件栈与训练策略全部细节。
所属事件:RTX 5090 上仅花数千美元从零预训练 2B 模型(2 条相关)→
「Infra」频道最新
- 开源 Discord AI 助手 Zauq:支持多模型路由与 Docker 沙箱 — rar_file-exe · 2026-08-28
- 数据中心暴利让电力公司拟降费,用户年省百美元 — bennash · 2026-08-28
- 为什么本地 LLM 感觉比云端更笨?技术细节全解析 — JeremyCMorgan · 2026-08-28
- 爆料称 GTA VI 游戏本体容量将介于 748GB 至 2TB 之间 — PtrPomorski · 2026-08-28
- 仅耗时 5 小时即可本地运行前沿 AI 模型 — MaziyarPanahi · 2026-08-28
- Qwen3.8 Flash Next 本地部署参数与性能测试分享 — Motor_Ad16 · 2026-08-28