新研究:模型增长架构省 20 倍算力,权重共享并非算力最优
burny_tech · x · 2026-09-19
arXiv 论文 2609.19107 系统考察了 looped transformer 中递归深度、模型增长与边界算子对 scaling 指数的影响:
- 权重共享在新鲜数据上并非算力最优:每个规模都带来约 1.06–1.16 倍的固定算力开销;它的优势只在多轮、数据受限训练中体现。
- looped 模型相对普通 transformer 的增益来自归一化+输入重注入的边界算子和训练中途增加深度,二者都能改善 scaling 指数,且都不需要权重共享。
- 模型增长(无论是否共享权重)对 scaling 指数改变最大:7.4B 增长架构以约 20 倍更少算力在 CORE 上比肩 GPT-3 13B,且算力效率优势随规模扩大。
- 在数据受限的多 epoch 场景,looping 有正则化效果,最优做法是随规模增加循环数。
所属事件:循环深度改写 scaling 指数:7.4B 模型省 20 倍算力匹敌 GPT-3 13B(7 条相关)→
「Infra」频道最新
- CoreAI Zoo 上架 App Store:iPhone 本地跑 Qwen/Gemma 等开源模型 — pcuenq · 2026-09-19
- MiniMax H3 生态一周爆发:量化、加速、训练工具与创作工作流全面开花 — Just_Lingonberry_352 · 2026-09-19
- AI 集群缺电太狠,SpaceX 拟自造燃气轮机叶片提速 18 个月 — AccBalanced · 2026-09-19
- 博主本地实测 27B 新模型 Bansai,仅需 5GB 内存 — draginol · 2026-09-19
- Inco Splash 引擎让 Qwen3.8-27B 在 M5 Max 上跑出 144 tok/s — TheMoonMidas · 2026-09-19
- 自组7卡家庭算力跑OCR,电费散热算下来不如直接调API — RexDouglass · 2026-09-19