4400 美元在 RTX 5090 上预训练出媲美 Qwen2-1.5B 的开源 2B 模型
IgorCarron · x · 2026-09-25
Puro-2B 项目发布了完全开源的 2B 模型预训练配方,声称可在消费级 RTX 5090 上从零训练一个匹敌主流小模型的 LLM:
- $4.4K:训练出的模型可超越 Qwen2-1.5B
- $6.9K:接近 Qwen2.5-1.5B 水平
- 全部配方(数据、流程、超参)公开,可复现
Igor Carron 转发并类比其博客 2021 年的「$1,000 GPT-3」一文:正如当年人类基因组测序成本从数亿美元暴跌至低于摩尔定律预测的水平,训练成本的急剧下降同样表明不能依赖单一技术的稳态进步,竞争会让商品化速度快于预期——如今「千美元级 GPT-3」式的成本坍缩正在小模型预训练上重演。
「Infra」频道最新
- 曝谷歌下周用猎鹰9号送TPU上天,测试轨道AI数据中心 — McDonaghMatthew · 2026-09-25
- NVIDIA 登顶美国企业市值榜,十年走势图引人注目 — lemire · 2026-09-25
- LithosAI 用 GPU 虚拟化推出多档推理服务,冲击 agent 推理性价比前沿 — JiaZhihao · 2026-09-25
- 模拟芯片跑注意力快 H100 百倍、省电七万倍,Nature 论文挑战冯·诺依曼架构 — anselm · 2026-09-25
- 医疗 AI 的 GPU 调度难题:临床推理要低延迟,科研任务要高吞吐 — Arindam_1729 · 2026-09-25
- 开源 LexiPanel:单面板管理本地 GPU 上的聊天/图像/语音 AI — W61k3r · 2026-09-25