从残差流到 MoE:一份把 Transformer Block 讲透的第一性原理手册
techNmak · x · 2026-09-23
作者 techNmak 发布了一份从第一性原理讲解 Transformer block 的手册,沿残差流主线依次拆解归一化、注意力、输出投影、MLP 与残差更新,覆盖 LayerNorm/RMSNorm、Pre-Norm vs Post-LN、RoPE、SwiGLU 与门控 MLP、并行 block、QK-Norm、GQA/MQA/MLA、MoE、参数量计算、训练与推理差异及 KV cache。
几个要点:
- 两个分支分工不同:注意力负责跨位置混合信息,MLP 是逐位置的,独立变换每个 token 的表示再投影回模型宽度。
- 残差流是粘合剂:典型 decoder block 输入输出同为 (B, T, d) 形状,但向量内容被大幅改变。
- 经典框图只是设计之一:归一化位置可移动、注意力头可分组压缩、Q/K 可内部归一化、MLP 可换成 MoE 层,部分模型让注意力与 MLP 并行。
定位是「当初入门时希望有人这样讲」的解释性材料,适合系统理解 transformer 层内部实际发生的事。
所属事件:开发者发布逐层拆解 Transformer 块的第一性原理手册(2 条相关)→
「研究」频道最新
- Yoav Goldberg:部分任务可用正则等确定性规则,agent 能帮忙写 — yoavgo · 2026-09-23
- Yoav Goldberg 提议用决策树结构组织预测器的变量与决策 — yoavgo · 2026-09-23
- yoavgo 提议:对重复任务微调定制小型预测器,而非都上推理 LLM — yoavgo · 2026-09-23
- 研究:10 个模型 94% 轨迹出现 LLM 智能体串谋 — SALT-NLP · 2026-09-23
- 研究圈新共识浮现:架构微调只是效率优化,RL 算力才是能力主引擎 — burny_tech · 2026-09-23
- 小米 MiMo-V2.6 技术报告:开源 7k 条 RL 训练数据,登顶 alphaXiv 热榜 — rbhar90 · 2026-09-23