仅花200美元从零训练1B参数大模型,作者全开源训练细节
SevereTilt · reddit · 2026-08-11
开发者分享了其从零训练 1.1B 参数大模型(Gemmeh)的完整实践过程,总成本仅约 200 美元。
模型与数据
- 架构基于 Gemma3,上下文长度设为 4096,词表缩小至 32k。
- 预训练数据使用 fineweb-edu,指令微调阶段使用 OpenOrca/OpenHermes 数据集进行 LoRA 微调。
训练过程
- 租用 vast.ai 算力,先在 2B tokens 上测试了 185M、500M 和 1.1B 三种参数规模。
- 最终对 1.1B 模型进行了 20B tokens 的完整预训练(使用 H100 耗时约 130 小时),最终验证集困惑度降至 10.93。
- 作者通过 W&B 定期记录固定 Prompt 的生成结果,直观展示了模型从输出乱码到生成连贯语义的进化过程。
项目已开源 base 模型、指令微调模型及 GGUF 量化版本。
「Infra」频道最新
- 开发者自建微虚拟机沙箱编码智能体,支持本地推理与 iOS 操控 — tom_doerr · 2026-08-11
- SanDisk CEO 称 80% 以上毛利率是对存储产品的合理回报 — Beth_Kindig · 2026-08-11
- 黄仁勋称英伟达正推动 AI 算力成为可投资资产类别 — Polymarket · 2026-08-11
- tinygrad eGPU 驱动获苹果批准,Mac 终于能外接 AMD/NVIDIA 显卡 — ns123abc · 2026-08-11
- 科技巨头算力预算超美国政府,赛博朋克已成现实 — tszzl · 2026-08-11
- 蔡司造出极致平滑镜片:EUV 光刻机精度的硬核科普 — DynamicWebPaige · 2026-08-11