交互式 Attention 图解页大更新:从缩放点积到 DeepSeek 潜注意力
vtabbott_ · x · 2026-09-28
vtabbott 联合 MIT 的 Gioele Zardini 大幅更新了交互式 Transformer 图解页面(zardini.mit.edu),用可交互的箭头-框图逐层拆解 Attention 机制。
内容包括:
- Attention 基础:缩放点积注意力及其训练步骤、带权重与残差连接的因果自注意力、多头注意力、分组查询注意力(GQA)
- 经典模型:原始 Transformer(Attention Is All You Need)、Mixtral-8x7B 的稀疏 MoE、DeepSeek-V3 的潜注意力 + MoE
- 现代模型:GLM 与 DeepSeek-V4.1-Flash 等新架构的图解
- 图解支持 Forward/Decode/Cached 等不同 pass 视角,并区分实数与发布代码中的量化数值格式
作者还展示了新特性:可并排对比标准计算图与广播(broadcasted)图,用「导线代表张量轴」的方式从简单图逐步构建到完全广播形式,帮助建立直觉。后续将发布系列讲解。
所属事件:MIT 交互式 Transformer 图解页大幅更新(2 条相关)→
「研究」频道最新
- 神经科学家驳「AI 非大脑」论:前沿模型表征已可预测灵长类皮层活动 — coherence · 2026-09-28
- ESPnet 发布百万级语音数据集 YODAS3,覆盖识别、翻译与合成 — espnet · 2026-09-28
- BoundInk 把字间边界作为显式生成单元,在线手写生成质量大幅提升 — SUNGKYUNARCH · 2026-09-28
- TUM 提出 Continuous Depth Batching,循环语言模型自适应推理提速 99% — TUM · 2026-09-28
- ARGUS 用 LLM 审计气候政策研究的因果识别假设,缺陷检出率 73% — Yonghong Zhang · 2026-09-28
- 用范畴论给深度学习画图:PyNCD 把 FlashAttention 画在餐巾上 — GioeleZardini · 2026-09-28