SMELT 论文:循环 Transformer 省 6.8-18% 训练算力,GPT-6 或采用

mark_k · x · 2026-09-03

清华大学、ByteDance Seed 与 TokenWave 的论文测试了 SMELT——一种 MoE 循环 Transformer,把中间一半的层跑两遍。关键在于对照实验控制了 FLOPs、参数量和 KV cache,收益无法用堆算力解释。

主要发现:

作者认为循环层可能成为下一代前沿模型的核心架构变化,并称 OpenAI 即将发布的 Astra/GPT-6 也据报基于此架构(未证实)。

所属事件:字节跳动等发布SMELT:MoE循环Transformer省近两成算力(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →