一个模型的注意力与MoE细节
nrehiew_ · x · 2026-07-16
这条在拆解一个模型的结构设计,重点包括两部分:
Attention 设计
- 使用 sliding window,作者觉得这有点意外,因为团队里有做线性注意力的强项。
- 在 KV 和 residual 上用了基础的 1D convolution。
- 没有 RoPE,而是通过 hidden state 投影后再结合距离相关的 position bias 来形成注意力权重。
MoE 设计
- 模型规模约 975B 参数,41B active,训练了 45T 多模态 token。
- 相比 Dsv3,active 参数大约多 10%,token 数是 3 倍。
- 采用 6 个 routed experts、256 experts,外加 2 个 shared experts;作者认为 2 个 shared experts 比较少见,通常大家只用 0 或 1 个。
整体是非常细的架构观察帖。
所属事件:Inkling 表现与相关架构猜测升温(7 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03