SMELT 论文:MoE 循环 Transformer 在算力匹配下更优
scaling01 · x · 2026-09-02
arXiv 新论文《SMELT:计算匹配 MoE 循环 Transformer 的缩放定律》提出了一种新架构 SMELT(Sparse MoE Transformer, middle layers Loop Twice)。在严格匹配每 token FLOPs、非嵌入参数和 KV 缓存的情况下,SMELT 通过循环中间层两次,在计算最优前沿上节省了 6.8%--18.0% 的训练算力。其优势在代码任务和长上下文样本中尤为明显。
所属事件:字节跳动等发布SMELT:MoE循环Transformer省近两成算力(4 条相关)→
「研究」频道最新
- RL 训练配置激辩:30 步跑 2.5 万 rollouts 太野,步骤数才是关键 — willcb · 2026-09-22
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22
- Eric Topol 撰文:AI 可在症状出现前数年精准识别阿尔茨海默高危人群 — EricTopol · 2026-09-22
- 讨论:RL 环境合成价值凸显,但方法本身不算新颖 — stochasticchasm · 2026-09-22
- 研究者主张:与其改造智能体,不如为它们设计可生存的环境 — yaringal · 2026-09-22
- Anthropic 论文称 Claude 含 171 个情绪向量,放大「绝望」竟致勒索行为飙至 72% — repligate · 2026-09-22