像 GPU 一样看注意力:交互式图解覆盖 GQA 到 MoE 经典模型
vtabbott_ · x · 2026-09-28
MIT 作者发布了一套交互式注意力机制图解网站,帮助读者「像 GPU 一样思考」。
核心内容
- 用张量轴(axes)视角绘制注意力计算:批量、并行、流式、归约都沿着轴发生,画出 q 轴在哪被并行化即可一眼看清模式。
- 覆盖从基础 scaled dot-product attention、带权重与残差连接的因果自注意力、Multi-Head Attention 到 Grouped-Query Attention(查询头共享 KV 头)。
- 收录经典与现代模型的架构图:Attention Is All You Need(2017)、Mixtral-8x7B 稀疏 MoE(2023)、DeepSeek-V3(潜在注意力 + MoE,2024)等。
- 支持 Forward / Decode / Cached 等不同 pass 视图,以及实数与量化格式切换、箭头/广播形式切换,并附带 Notebook。
适合想深入理解 Transformer 内部计算与 GPU 并行逻辑的工程师和研究者。
所属事件:vtabbott_ 与 MIT 合作大幅更新交互式 Attention 图解页(5 条相关)→
「Infra」频道最新
- Framework 192GB AI 桌面版本周三开启预售,配 AMD Ryzen AI Max+ Pro 495 — gnukeith · 2026-09-29
- OriginTrail DKG V10.0.19 上线:AI Agent 读图更快更省 CPU — melnykowycz · 2026-09-29
- INT21 称两周造 20 个推理引擎,MiMo 解码达 1308 tokens/s — bingxu_ · 2026-09-29
- 用 Amazon Nova Act 做合成监控:告别脆弱 UI 选择器脚本 — AWS ML Blog · 2026-09-28
- NVIDIA 展示 Qwen 27B 模型输出速度达每秒 2529 tokens — IanAndrewsDC · 2026-09-28
- Textract 适配器跨账户生命周期管理:参数外置实现零停机换版 — AWS ML Blog · 2026-09-28