字节跳动研究:循环 Transformer 计算效率反超,加深模型或非最优解

georgejrjrjr · x · 2026-09-03

针对『为什么不直接把模型做深』的常见质疑,作者结合字节跳动的新研究给出猜测:在数据受限的场景下,更少的 token 容量反而可能带来更好的泛化;而循环 Transformer(looped transformers)展示了计算效率不一定因此受损——作者称这是新发现。此前 looped transformer 常被认为不如标准深网络,这项工作改变了这一认知,对架构设计与算力分配有参考意义。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →