Looped Transformer 从头训练更优,两次 pass 最划算
jm_alexia · x · 2026-07-27
Looped Transformer 技术报告的几个关键结论
这条转述总结了循环式 Transformer 架构的一组消融发现:
- 从头训练比“上采样”改造现成 Transformer 更好。把预训练标准 Transformer 直接改成 loop 架构,效果明显更差。
- 两次 pass 可能是最优点:继续增加 pass 只带来有限收益,却会显著拉高训练成本,并让优化更不稳定。
- KV 共享并非免费:虽然能把 KV cache 内存减半,但性能一直弱于每个 pass 使用独立 KV 状态的完整 loop 版本。
- 深度与宽度不能单独调:stack depth、hidden width 和 loop 次数必须协同设计,才能在能力、训练成本和推理效率之间取得平衡。
上下文还提到 Nanbeige4.2-3B:这是一个采用 Looped Transformer 的 3B 模型,作者称它在不增加参数的情况下提升了容量;Nanbeige4.5 也已经在训练中,并使用 LoopSplit、mHC+depth attention 和拼接 n-gram embeddings。
「模型」频道最新
- Claude Opus 5 一次生成通过滑雪者测试 — rohanpaul_ai · 2026-07-27
- GPT 5.6 Pro 被指比 Work/Codex 高档位更强 — latticecut · 2026-07-27
- 开发者称 Codex 已成自己在 ChatGPT 里的编程环境 — kevinkern · 2026-07-27
- Nebius 为明天的 Kimi 发布做准备,招聘影响更大 — demian_ai · 2026-07-27
- Claude Opus 5 在 VoxelBench 排第三,距第一仅差 30 Elo — legit_api · 2026-07-27
- 一条转发强调:开源模型和开放权重不是一回事 — RisingSayak · 2026-07-27