单张 RTX 3090 训 8 天:GPT-2 改造 MoE 从零训练成功

rasbt · x · 2026-09-11

开发者 Giles Thomas 基于 Sebastian Raschka《Build a Large Language Model (from Scratch)》中的 GPT-2 风格代码,将其改造成 6 专家(激活 2 个)的混合专家(MoE)模型,并在单张 RTX 3090 上从零训练 8 天,效果良好。完整博客包含数学推导与代码。Raschka 本人也转发称赞:有趣的 LLM 工作在单 GPU 上也能做。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →