循环深度改写 scaling 指数:7.4B 模型省 20 倍算力匹敌 GPT-3 13B
andrewgwils · x · 2026-09-17
Andrew Gordon Wilson 团队的新论文挑战了「架构干预无法改变 scaling 指数」的传统认知,核心发现:
- 循环即模型增长:looped transformer 的递归深度(looping)可作为模型增长机制——训练时增加循环次数即可提升「可用深度」。
- 关键数据:7.4B 模型增长架构在 CORE 基准上以约 1/20 的算力匹敌 GPT-3 13B,且算力效率收益随规模递增。
- 边界算子:即使在普通 transformer 中只加一个 boundary operator(归一化并注入更早的 block),也能带来随规模递增的算力效率提升,幅度略小。
- 数据受限场景:多 epoch 重复数据下,标准 looping 有正则化效果,最优策略是随规模增加循环次数。
论文认为这些结果可用「计算深度」视角理解:给定算力预算下提升 transformer 的可用深度,可获得随规模放大的效率收益。
所属事件:循环深度改写 scaling 指数,7.4B 模型省 20 倍算力(4 条相关)→
「研究」频道最新
- Noam Brown 深谈 Agent 集群、对齐与递归自我改进 — Recoil42 · 2026-09-18
- The Information:OpenAI 接近攻克又一道千禧年数学难题 — ResultBackground2450 · 2026-09-17
- STEER 开源:双向对话驱动的可控 3D 头部虚拟人面部动作生成 — rsasaki0109 · 2026-09-17
- 前 Google 研究员设想 AI 驱动全球病原体实时监测网络 — anshulkundaje · 2026-09-17
- 归一化后概率信息全丢,开发者争论预测模型训练信号缺陷 — spikedoanz · 2026-09-17
- 68000 条提示词研究:用户日益把 LLM 当「神谕」,多数人毫无察觉 — ValerioCapraro · 2026-09-17