不到 7 千美元:清华团队在 RTX 5090 上预训练 2B 模型
thu-pacman · hf · 2026-08-31
清华 PACMAN 团队发布 Puro-2B(基于 Qwen2-1.5B 架构,称 "Poor Lab's"),一套高性价比开源预训练配方:
- 在消费级 GPU(RTX 5090)上以 $5090 以内 的成本预训练 20 亿参数模型;
- 性能接近更大的基线模型;
- 过程中推导了成本缩放定律,并研究了数据课程(data curricula)的影响。
对个人和小团队复现预训练实验很有参考价值。
所属事件:Puro-2B 发布:RTX 5090 耗资不足 $5090 复刻 Qwen(4 条相关)→
「Infra」频道最新
- 实测 API 调用成本:Token 价格非唯一指标,重试费与计费模式更关键 — Few-Market-6535 · 2026-08-31
- 不要用 LLM 快速构建多租户数据库,维护成本极高 — kylegawley · 2026-08-31
- SemiAnalysis 团队实测:多家十亿美元级 Neocloud 存在严重安全漏洞 — AccBalanced · 2026-08-31
- Medusa 从训练到推理全解:多 token 预测加速的两部曲教程 — No_Progress_5399 · 2026-08-31
- 曝 OpenAI 大量采购 Mac Studio 做 RL 训练 — SumitGup · 2026-08-31
- 数据中心建设报道应借鉴昔日电报电缆铺设法 — jwt0625 · 2026-08-31