Mixture-of-Depths:让Transformer按token动态分配算力
burny_tech · x · 2026-09-23
一条推文介绍了论文《Mixture-of-Depths: Dynamically allocating compute in transformer-based language models》(arXiv:2404.02258)。
- 核心思路:Transformer 目前把 FLOPs 均匀分摊到整个输入序列上,该工作让模型学会把算力动态分配到序列中的特定位置,并在不同层之间优化分配。
- 机制:通过 top-k 路由,限制每层参与 self-attention 和 MLP 计算的 token 数量 k,从而在总量上固定算力预算。
- 优势:k 预先设定,计算图静态、张量尺寸已知,不同于其他条件计算技术;但被选中的 k 个 token 身份是流动的,因此算力在时间和深度维度上可非均匀分配。
- 结果:在同等 FLOPs 和训练墙钟时间下达到基线性能,但每次前向传播所需 FLOPs 更少,后训练采样阶段提速可达 50% 以上。
「研究」频道最新
- EPFL 量子 CNN 仅用 10 个样本学会识别数字,同级经典 CNN 仍是随机水平 — PlisSergey · 2026-09-23
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23
- 剑桥出版高维统计新教科书,Samworth 与 Shah 合著免费开放 — FrnkNlsn · 2026-09-23
- Reinforce-Ada:按难度自适应分配算力,RLVR 收敛加速至 2 倍 — burny_tech · 2026-09-23
- 论文:Transformer 并非没有世界模型,而是特征叠加互相干扰 — burny_tech · 2026-09-23
- 新论文称 Transformer 难以学会 loop-closure 世界建模 — burny_tech · 2026-09-23