SMELT 论文:中层层循环两次,MoE 训练省 6.8-18% FLOPs
iScienceLuvr · x · 2026-09-02
新论文 SMELT(Sparse MoE Transformer,middle layers Loop Twice)研究在 MoE Transformer 上做层循环(looping),同时严格匹配每 token FLOPs、非嵌入总参数量和 KV cache 三项预算。
核心做法是将中间一半的层循环两次,在三项预算上与不循环的基线持平。作者在四个规模(最高 54B 非嵌入参数)上扩展实验,并为每种架构拟合独立的 Chinchilla 式 scaling law。
结论:SMELT 的 loss 随算力下降更快,在 compute-optimal 前沿上可节省 6.8%–18.0% 的训练 FLOPs。
所属事件:字节跳动等发布SMELT:MoE循环Transformer省近两成算力(4 条相关)→
「研究」频道最新
- RL 训练配置激辩:30 步跑 2.5 万 rollouts 太野,步骤数才是关键 — willcb · 2026-09-22
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22
- Eric Topol 撰文:AI 可在症状出现前数年精准识别阿尔茨海默高危人群 — EricTopol · 2026-09-22
- 讨论:RL 环境合成价值凸显,但方法本身不算新颖 — stochasticchasm · 2026-09-22
- 研究者主张:与其改造智能体,不如为它们设计可生存的环境 — yaringal · 2026-09-22
- Anthropic 论文称 Claude 含 171 个情绪向量,放大「绝望」竟致勒索行为飙至 72% — repligate · 2026-09-22