斯坦福 CS336 从零手写 LLM:完整笔记与代码开源,附 GRPO 等关键实验发现
stanfordnlp · x · 2026-09-22
一位完成斯坦福 CS336(Language Modeling from Scratch)全部 5 个作业的学员分享了学习笔记,并开源了全部从零实现(不依赖 Hugging Face,纯 PyTorch + Triton):tokenizer、Transformer、Triton kernel、分布式训练、scaling laws 到 GRPO 对齐。
关键实验结论:
- FFN vs Attention:短序列(1024)下 FFN 占主导,这正是 MoE 放在 FFN 的原因;上下文到 16k 时注意力才反超。
- 分布式训练:2 卡朴素 DDP 中 54% 的每步耗时是梯度同步;把通信与 backward 重叠后降到 3%;ZeRO-1 分片把峰值显存从 68.7GB 降到 47.7GB。
- GRPO 与 RL:用 r1-zero 的 prompt,base 模型在 GSM8K 上 1300 题全错;换成 3-shot prompt 后答对 224 题——RL 最有效的场景是放大模型已有的信号。
课程材料与代码仓库(含 writeup)均已公开,适合想理解 LLM 底层实现的学习者。
「公司和人」频道最新
- Altman 呼吁 AI 标准:外部人士应有话语权,防止权力集中 — patience_cave · 2026-09-22
- Snorkel AI 融资 3.5 亿美元估值 35 亿,ARR 突破 3.75 亿 — ajratner · 2026-09-22
- benhylak 回忆入职苹果首周:被同事直评设计太烂 — floguo · 2026-09-22
- MIT 科技评论 35 岁以下创新者榜单:AI agents 创业者 Hafner 入选 — thegautamkamath · 2026-09-22
- Dreamforce 演讲:AI 能生成工作,信任仍需自己赢得 — i_am_dy · 2026-09-22
- Rippling 在班加罗尔设立 AI Lab,聚焦企业级 Agent 与模型 — SuB8u · 2026-09-22