单张 RTX 3090 训 8 天:GPT-2 改造 MoE 从零训练成功
rasbt · x · 2026-09-11
开发者 Giles Thomas 基于 Sebastian Raschka《Build a Large Language Model (from Scratch)》中的 GPT-2 风格代码,将其改造成 6 专家(激活 2 个)的混合专家(MoE)模型,并在单张 RTX 3090 上从零训练 8 天,效果良好。完整博客包含数学推导与代码。Raschka 本人也转发称赞:有趣的 LLM 工作在单 GPU 上也能做。
「Infra」频道最新
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- mlx.fast 挑战赛:Qwen3.8 125B 在 Mac 上投机解码提速 15.3% — TheMoonMidas · 2026-09-11
- Olam Labs CEO:AGI 只剩算力和数据两个瓶颈 — garrytan · 2026-09-11
- Apex 开源推理加速方案:通用加速结构化模型的关键发布 — AllThingsApx · 2026-09-11
- NVIDIA 单季数据中心营收 890 亿美元,算力不能再当 IT 开支看 — PeterDiamandis · 2026-09-11
- 实验室 Xeon 跑 DeepSeek V4.1,CPU 纯 CPU 推理项目开源 — Qwen30bEnjoyer · 2026-09-11