新论文称循环加模型生长可弯折缩放律,算力收益随规模指数放大
akbirthko · x · 2026-09-17
作者团队发布新论文,挑战「架构改进只能带来常数因子增益、预训练进步主要靠数据」的主流假设。他们发现模型生长(model growth)、循环(looping)与边界算子的组合,能让对标准 Transformer 的算力乘数随每增加一个数量级算力而指数级增长:
- 在 1e20 FLOPs 处为 1.55 倍,预计 1e25 处达 2.7 倍
- 在 CORE 基准上以 少 20 倍算力匹配 GPT-3 13B 的表现
核心主张是 scaling 指数本身可以通过架构改动提升,收益随算力复合增长,而非只有数据在驱动预训练进步。
所属事件:新论文称循环深度训练可改写 scaling 指数省 20 倍算力(4 条相关)→
「研究」频道最新
- 爆料称 OpenAI 接近解决 Hodge 猜想,又一千禧年难题 — haider1 · 2026-09-17
- LLM「神谕」使用研究全文:用户日益让模型替自己判断 — ValerioCapraro · 2026-09-17
- 68000 条提示词研究:用户日益把 LLM 当「神谕」,多数人毫无察觉 — ValerioCapraro · 2026-09-17
- Liquid 与英矽智能登 Cell 封面:小模型在长寿任务上超越 GPT-5 等前沿模型 — helloiamleonie · 2026-09-17
- 汉阳大学微型磁控机器人集群:千机协同举起 350 倍自重 — TinfoilTricorn · 2026-09-17
- 合成数据让人体检测 mAP50 提升 160%,AWS 公开工业安全 AI 流水线 — AWS ML Blog · 2026-09-17