7500 行代码教你从零训练现代语言模型
tom_doerr · x · 2026-08-23
GitHub 用户 raiyanyahya 发布了一个名为 'How to Train Your GPT' 的交互式教科书,包含 12 个章节和超过 7500 行完全注释的 Python 代码。
该项目旨在像教五岁孩子一样解释如何从零开始构建、训练和运行现代语言模型(如 ChatGPT、Claude、LLaMA 架构)。除了核心章节,还包含 28 个独立的主题解释器,深入涵盖 RoPE、Attention、RMSNorm、SwiGLU、KV cache、AdamW 和混合精度等关键技术细节。
项目地址:https://github.com/raiyanyahya/how-to-train-your-gpt
「研究」频道最新
- Marin 启动 535B-A23B 开放训练:18.75T tokens、11 组 GB200 跑约 3 个月 — _ScottCondron · 2026-08-23
- Prompt Injection 损失极小?攻击成本降低或带来新风险 — joshua_saxe · 2026-08-23
- 硬核移植:将 Ninfer 移植至 CMP 170HX,Qwen 性能翻倍 — ubrtnk · 2026-08-23
- Claude 与 Codex 闯关 Cayley 666 难题:为何越来越难 — AndLukyane · 2026-08-23
- 研究:错误配置的 Admin 提示可击穿安全层 — Simple_Passion_7741 · 2026-08-23
- ProteinDPO 用偏好对齐解决蛋白模型对齐问题 — bravo_abad · 2026-08-23