Andrej Karpathy 发布 llm.c:纯 C/CUDA 实现 LLM 训练
goyalshaliniuk · x · 2026-08-19
Andrej Karpathy 发布了 llm.c 项目,旨在使用简单、可读的纯 C/CUDA 代码训练大语言模型,无需依赖 245MB 的 PyTorch 或 107MB 的 cPython。
- 核心目标:专注于预训练,当前重点是复现 GPT-2 和 GPT-3 mini 系列,并提供并行的 PyTorch 参考实现。
- 性能表现:目前主分支代码比 PyTorch Nightly 快约 7%。
- 代码结构:除了最前沿的 traingpt2.cu,还包含约 1000 行简洁的 CPU fp32 参考实现 traingpt2.c。
- 维护原则:作者希望仓库仅维护 C 和 CUDA 代码,不涉及其他语言移植。
「Infra」频道最新
- Anthropic 的 Astra 推理多级监控机制曝光 — AccBalanced · 2026-08-19
- Brex 报告:AI 热潮赢家是基础设施而非应用 — simonguozirui · 2026-08-19
- Alchemy 作者:面向 Agent 时代的极简云基础设施工具 — samgoodwin89 · 2026-08-19
- 实测 DeepSeek Harness:GLM 与 Kimi 缓存命中率近 99% — sandyyevans · 2026-08-19
- 五一视界发布具身数据底座:人机采集效率提10倍 — 量子位 · 2026-08-19
- AMD 公布 MI355X 运行 verl 异步 RL 教程及与 B300 对比 — AnushElangovan · 2026-08-19