从 GPT-2 到 Kimi3:万字长文解析大模型架构演进史
iamrobotbear · x · 2026-08-10
这篇长文及配套科普视频回顾了从 GPT-2 到 Kimi3 的大语言模型(LLM)架构演进史。
- 算力规模跃升:作者指出,Kimi3 的参数规模相当于 22580 个 2019 年的 GPT-2 模型,七年间的扩张倍数令人惊叹。
- 核心技术解析:内容深入拆解了 Token、嵌入、残差流、注意力机制、KV 缓存等基础概念,并梳理了线性注意力、Delta 规则、KDA、MLA、稀疏专家路由等进阶架构的演进脉络。
- 行业贡献:视频制作中使用了 Codex 和 GPT-5.6 进行头脑风暴与代码辅助,并致敬了 Google、OpenAI、Moonshot 等机构的重要工作。
「研究」频道最新
- UIST论文:生成式AI干预系统GUIDE减压效果显著 — Diyi_Yang · 2026-08-10
- PhyLatent: 优化 JEPA 世界模型表征,提升机器人控制成功率 — burny_tech · 2026-08-10
- CISPO后训练算法发布,提升模型对齐能力 — Sauers_ · 2026-08-10
- SR-JEPA:在 3D 场景中学习预测潜在状态 — burny_tech · 2026-08-10
- 多机构综述重塑「自我改进Agent」版图:快环探索,慢环固化 — 新智元 · 2026-08-10
- NanoGPT 训练提速新纪录:FP8 优化突破 73.8 秒 — kellerjordan0 · 2026-08-10