字节研究表明循环 Transformer 计算效率更优,加深模型或非最优解

围绕『为什么不直接把模型做深』的质疑,有讨论结合字节跳动的新研究指出:在数据受限场景下,更少的 token 容量可能反而带来更好的泛化,而循环 Transformer 在计算效率上实现反超。另有更正指出,字节此前的 Parcae 论文已在 isoFLOP 与 isoParameter 设定下证明循环结构占优,新研究则首次在 FLOP、参数与 KV 缓存三项同时对齐的条件下确认了循环深度模型的优势。

2026-09-03 ~ 2026-09-03 · 2 条相关