LLM 架构长演进梳理到 Kimi K3
baseten · x · 2026-07-28
这是一篇把 2017 年以来的 LLM 架构演进 一路梳理到 Kimi K3 的长文/工作笔记。
- 文章把 Kimi K3 放在一条长期的架构与规模演进链条里看,而不是单独当作一次发布。
- 被引用的文章里用一个夸张对比说明规模变化:按文中说法,22,580 个 GPT-2 级别模型才能装进一个 Kimi K3 量级的系统里,用来强调 2019 以来模型尺度的巨大变化。
- 整体更像是给想看“架构时间线”的人准备的技术阅读,而不只是新闻转述。
所属事件:Kimi K3 架构深度解析:2.8T参数与注意力机制革新(16 条相关)→
「研究」频道最新
- 新 scaling law 发现:部分规模下重复训练胜过改写 — burny_tech · 2026-07-29
- 经验蒸馏复现:保住 44.1% 的代理 ICL 增益 — burny_tech · 2026-07-29
- Cohere Labs 将在 Deep Learning Indaba 带来 Triton 教程和 AI 圆桌 — Cohere_Labs · 2026-07-29
- DeepMind 重组 AlphaFold 团队,人才转向 Gemini 和 Agent — 机器之心 · 2026-07-29
- UltraEP 把 MoE 实时均衡带进小红书机架级推理栈 — 机器之心 · 2026-07-29
- Triangle Splatting SLAM 用可微三角形做密集 RGB-D 建图 — janusch_patas · 2026-07-29