SMELT 论文:循环 Transformer 省 6.8-18% 训练算力,GPT-6 或采用
mark_k · x · 2026-09-03
清华大学、ByteDance Seed 与 TokenWave 的论文测试了 SMELT——一种 MoE 循环 Transformer,把中间一半的层跑两遍。关键在于对照实验控制了 FLOPs、参数量和 KV cache,收益无法用堆算力解释。
主要发现:
- 达到相同 loss 所需训练 FLOPs 减少 6.8-18%
- 编码任务上计算效率提升达 20.4%,序列越长、in-context 示例越多,收益越大
- 第二遍时注意力从无用的 attention sink token 转向真正相关内容,说明模型不是重复计算,而是在精炼
作者认为循环层可能成为下一代前沿模型的核心架构变化,并称 OpenAI 即将发布的 Astra/GPT-6 也据报基于此架构(未证实)。
所属事件:字节跳动等发布SMELT:MoE循环Transformer省近两成算力(4 条相关)→
「模型」频道最新
- 论战补充:用前沿模型攻数学难题仍是「极客专属」 — felpix_ · 2026-09-22
- Meta Muse 曝零日漏洞,本地进程可窃取提示词与认证凭据 — MicahBerkley · 2026-09-22
- Grok 4.7 现身:用户热议新模型,期待用量额度重置 — BWay124 · 2026-09-22
- 延续争论:OpenAI 招揽博士团队正是为驾驭前沿模型 — felpix_ · 2026-09-22
- 研究者:普通人靠 prompt 难让模型解决自然科学难题 — felpix_ · 2026-09-22
- 开发者热论:基准测试毫无意义,模型之间只剩「感觉」差异 — gnukeith · 2026-09-22