5000 美元在 RTX 5090 上训练 Qwen3-1.5B
kalyan_kpl · x · 2026-09-01
论文提出了一种开源预训练方案,在 5000 美元预算内使用 RTX 5090 训练 Qwen3-1.5B 模型。该效率通过硬件选择、低精度训练、超球优化、课程模型平均及数据配方实现。作者发布了 Puro-2B 模型的完整训练配方,包括数据、代码和 Apache 2.0 许可的权重。
所属事件:清华团队开源Puro-2B:五千美元级单卡预训练2B模型(6 条相关)→
「Infra」频道最新
- 曝 Anthropic 十年算力承诺达 5170 亿美元,已签 14.8GW — FinanceYF5 · 2026-09-21
- Laya MPS:在 Apple Silicon 本地跑 Jev 决策,延迟约 32ms — afshinmeh · 2026-09-21
- 爆料称 NVIDIA 下一代游戏 GPU 或推迟到 2028 年 — mark_k · 2026-09-21
- AMD 显卡 ComfyUI 跑 Minimax H3:本地生成 1080p 视频全流程 — mwhjose · 2026-09-21
- ISTA 实验室实验:prefill/decode 分开量化,27B 模型 GGUF 压到 13.7GB — victormustar · 2026-09-21
- 用量限额让定时 Agent 任务集体停摆 19 小时,团队复盘出四条防呆改造 — lilythemoon54 · 2026-09-21