9.9K 星开源仓库:纯 PyTorch 手写全流程,13M 参数从预训练练到 GRPO
techNmak · x · 2026-09-20
GitHub 上一个 9.9K 星的仓库 train-llm-from-scratch 把整个 LLM 工程课程塞进了一个代码库。
- 从原始文本出发,基于 Attention is All You Need 用纯 PyTorch 手写 Transformer,不依赖 transformers、trl、peft 等库隐藏训练循环
- 全流程覆盖:预训练 → SFT → 奖励建模 → DPO → PPO → GRPO,直到得到对齐后的推理风格模型
- 最小模型只有 13M 参数,单张 GPU 就能跑通,可以清楚观察每个训练阶段模型的变化
- 附带 notebook、配置、文档和 Streamlit UI,适合想理解训练细节的人逐行学习
所属事件:开源项目爆火:纯 PyTorch 从零训练自己的 LLM(2 条相关)→
「研究」频道最新
- 新研究:蒸馏输出变长源于师生 EOS token 不一致 — tw_killian · 2026-09-20
- XGEN 发布生成式世界模拟系统 JING+DAO,登顶 WBench 榜单 — hey_abusiddik · 2026-09-20
- Schmidhuber 重申:LLM 不算真正有创造力,缺了压缩进步机制 — SchmidhuberAI · 2026-09-20
- 实测 Jev 判 NASA 开普勒信号:总准确率仅 54%,输给三条规则基线 — This_Cell_1829 · 2026-09-20
- François Fleuret 给训练曲线起绰号,研究者:我也骂我的基线 — giffmana · 2026-09-20
- HN 热议:OpenAI 用自家 LLM 辅助设计自研 Jalapeño 芯片 — petrusenko_max · 2026-09-20