开源项目手写 PyTorch 复现 Transformer,免费从零训出 13M 参数模型
thisguyknowsai · x · 2026-09-29
一个完全开源的循序渐进项目,带你从原始数据到能写出英文的模型:
- 数据:下载并预处理 The Pile(约 825GB 文本)
- 逐行手写 PyTorch 实现 multi-head attention、MLP、layer norm、causal masking,全部基于《Attention Is All You Need》
- 训练模型并用它生成文本
- 规模:13M 参数可在免费 Google Colab GPU 上训练,单张 A100 可到约 2B 参数,免费档一天内即可生成通顺英文
- 每部分代码都附带解释
「编程与Agent」频道最新
- Relic 把多智能体协作经验变成可执行组织规则,交付率升至 19.76% — ulab-ai · 2026-09-29
- 小米提出 GAGAR:智能体评分重分配优势,改进代码 Agent RL 训练 — XiaomiMiMo · 2026-09-29
- 让两个 AI 生成赛博朋克版俄勒冈之旅,耗时差距惊人 — BertMacklenF8I · 2026-09-29
- 开发者实测:同一个 agent 既写代码又自验,坑在哪 — T_hompson · 2026-09-29
- ITIS MCP 服务器上线:让 LLM 直查分类学数据库 — modelcontextprotocol · 2026-09-29
- 客服 agent 也要记住「自己说过什么」:一份记忆设计复盘 — sunayana-12 · 2026-09-29