清华联合字节 Seed 推出 SMELT,首次公平对比 Looped Transformer
jiqizhixin · x · 2026-09-18
Looped Transformer 通过重复执行同一层来加深计算,不增加参数,在推理与数学任务上展现出潜力,但一直存在一个未被公平回答的问题:收益究竟来自循环架构本身,还是仅仅因为算了更多次、用了更多 FLOPs?
清华大学与 ByteDance Seed 提出 SMELT,首次在多个模型规模上做公平比较:
- 公平对比需同时控制三个变量:每 token FLOPs(决定训练与推理成本)、总参数量(决定知识容量)、KV cache(限制可服务上下文长度)
- SMELT 用 MoE 控制参数量,同时匹配 FLOPs 与 KV cache,使 Looped 与标准 Transformer 在真正等预算下对比
- 第一作者为 Sha…(原文截断)
「研究」频道最新
- SceneAgent:将 3D 采集自动转为物理仿真场景,供机器人策略训练 — hankyang94 · 2026-09-18
- LAX 发布:自然数学语言直连 Lean,可形式化复杂度类结果 — lpachter · 2026-09-18
- Fari 研究院新论文:失准 AI 无需逃逸,说服监督者即可 — DG_Rand · 2026-09-18
- 生物医学世界模型框架提出:虚拟试药、逆向干预设计与序贯规划 — marinkazitnik · 2026-09-18
- LeanReact 0.1 发布:用 Lean 类型系统表达组合正确的前端组件 — hargup13 · 2026-09-18
- Cell 刊文提出「生物医学世界模型」框架:从分子到患者的虚拟模拟 — marinkazitnik · 2026-09-18