字节跳动研究:循环 Transformer 计算效率反超,加深模型或非最优解
georgejrjrjr · x · 2026-09-03
针对『为什么不直接把模型做深』的常见质疑,作者结合字节跳动的新研究给出猜测:在数据受限的场景下,更少的 token 容量反而可能带来更好的泛化;而循环 Transformer(looped transformers)展示了计算效率不一定因此受损——作者称这是新发现。此前 looped transformer 常被认为不如标准深网络,这项工作改变了这一认知,对架构设计与算力分配有参考意义。
「研究」频道最新
- 蒸馏疑云再补刀:SFT+RL 组合让「偷懒蒸馏」说法站不住脚 — JoshPurtell · 2026-09-03
- 训练数据真靠蒸馏?博主质疑某模型蒸馏自 sol 的说法 — JoshPurtell · 2026-09-03
- 微调文本编码器破解 Ideogram 4 横幅并提升自然语言遵循 — mrjackspade · 2026-09-03
- 长程 agent 难靠蒸馏,数据合成难度天差地别 — JoshPurtell · 2026-09-03
- AI 创业者提出「信任天花板」:数万亿美元价值卡在不可信的 ML 上 — williamtp · 2026-09-03
- TDmol 用 2D 分子结构做桥梁,文本引导 3D 生成相似度提升 41% — bravo_abad · 2026-09-03