Kaplan 2020 Scaling Laws:损失随算力数据参数呈幂律
thisdudelikesAI · x · 2026-09-12
作者推荐「想成为前 1% AI 工程师该读」的 12 篇论文系列之一:Kaplan 等人 2020 年的 Scaling Laws for Neural Language Models。
核心发现:
- 语言模型的交叉熵损失随模型规模、数据集大小和训练算力呈幂律下降,趋势可跨越 7 个数量级
- 网络宽度、深度等架构细节在很大范围内影响甚微
- 可据此推导固定算力预算下的最优分配方案
- 大模型样本效率显著更高:算力最优的训练方式是在相对适量的数据上训练超大模型,并在收敛前提前停止
作者评论称,此后每一次「把模型做大」的决策都可追溯回这篇论文。
「研究」频道最新
- Nature MI 论文提出统一框架:从神经叠加到稀疏可解释编码 — GretaTuckute · 2026-09-12
- 星尘智能 SmoothRL:异步执行下机器人在线 RL 只学真正执行的动作 — jiqizhixin · 2026-09-12
- 为个人助手记忆系统自建评测,adebench 打出 93.7 分 — Soft-Lie-434 · 2026-09-12
- ECCV 现场激辩:视频生成模型是否让显式 3D 表征变得多余 — qixing_huang · 2026-09-12
- OpenAI 宣称攻克千禧年大奖难题,数学界却陷入不安 — The Verge AI · 2026-09-12
- 果蝇全脑模拟接入 1B 小模型:13.9 万神经元陪你聊天 — TinfoilTricorn · 2026-09-12