MIT交互式图解:从Attention到Mixtral、DeepSeek-V3架构
vtabbott_ · x · 2026-10-03
有人分享了一个来自 MIT(zardini.mit.edu)的交互式 Transformer 架构图解工具,可切换查看多种模型的内部结构:
- 基础组件:缩放点积注意力及其训练步骤、带权重与残差连接的因果自注意力、多头注意力、分组查询注意力(GQA);
- 经典模型:Attention Is All You Need(2017)、Mixtral-8x7B 稀疏专家混合(2023)、DeepSeek-V3 潜在注意力+MoE(2024);
- 现代模型:Kimi K3 的 Delta 注意力与注意力残差、GLM-5.3 的 MoE+稀疏注意力、DeepSeek-V4.1-Flash、MiMo-V2.6-Pro 的滑窗注意力+MoE;
- 交互功能:可在 Decode 与 Cached 模式间切换,展示 KV-cache 应放置的位置,并给出 prefill 与推理形式之间的可表达关系;支持量化/非量化(FP 与实数)视图切换,箭头与广播方式可视化,并附 Notebook。
作者称抽象表示的好处是可以直接「推导」出 KV-cache 的位置。
「编程与Agent」频道最新
- OpenClaw 将腾讯 AI-Infra-Guard 接入 ClawHub 插件安全审查流水线 — heyneighbor · 2026-10-03
- Hermes Agent 支持一键安装 MCP,四步接入 DeepWiki — GrowthHackingEU · 2026-10-03
- Seroter 每日阅读清单:AI 编码助手如何改变工程工作形态 — rseroter · 2026-10-03
- OpenClaw 上线 50+ 官方插件,Notion、Canva、Dropbox 直接对话安装 — heyneighbor · 2026-10-03
- banteg 拆解 AI 视频工作流:67 镜只留 3 个,自制 three.js 合成引擎 — banteg · 2026-10-03
- 开发者自建 LangGraph 编排层,吐槽多意图路由无现成工具 — Creative_Divide9845 · 2026-10-03