新论文:修改递归深度可提升预训练 scaling 指数,越大规模越省算力
bo_wangbo · x · 2026-09-17
Andrew G. Wilson 团队发布新论文,展示通过对模型生长中的递归深度(looping)进行修改,可以改善预训练的 scaling 指数——意味着算力效率的增益随规模增大而扩大。这与常见的「堆更多数据与参数」路线互补,指向一种通过架构设计而非单纯加大投入来提升规模效率的方向。论文详情见推文附链。
所属事件:循环深度改写 scaling 指数,7.4B 模型省 20 倍算力(4 条相关)→
「研究」频道最新
- 曝 OpenAI 用代号 Doug 的新模型逼近破解千禧年大奖难题 Hodge 猜想 — kimmonismus · 2026-09-18
- 研究尝试:48 头注意力校准压缩到 12 头,其余换带状稀疏注意力 — ostrisai · 2026-09-18
- NVIDIA 开源 NeMo Data Designer:声明式配置生成合成数据,把 Nemotron 成绩提 6.7 个点 — dair_ai · 2026-09-18
- 博主实测发现前沿基准数据问题,移植Agents'LastExam CLI子集 — dejavucoder · 2026-09-18
- Nemotron 团队架构洞见:混合 Mamba-Transformer 无需 RoPE,少量注意力层补齐两大短板 — gordic_aleksa · 2026-09-18
- FOOM 递归自我改进仅在 P=NP 时成立?一条推引出复杂性思辨 — jessi_cata · 2026-09-18