一文梳理:解释各类 Scaling Law 背后机理的六篇论文
burny_tech · x · 2026-10-04
楼主整理了一批试图从理论层面解释各种 scaling laws(预训练、RL、测试时计算、agent 数量等)的论文,并摘录核心观点:
- Explaining Neural Scaling Laws:模型本质上在解析一个平滑的数据流形,测试损失的 scaling 行为源于协方差矩阵谱的渐近衰减。
- The Quantization Model of Neural Scaling:网络的知识与技能被「量子化」为离散块(quanta),按使用频率从高到低的顺序学习;平滑的 scaling law 是对小离散跳变的平均。
- Spectral Reach:训练过程中,学习从主导特征模态逐渐转移到谱尾部;更大的模型能触达更深的谱尾部,揭示一种依赖规模的容量(spectral reach)。
- A Solvable Model of Neural Scaling Laws:找出 scaling law 产生的必要条件,提出联合生成式数据模型+随机特征模型,解释数据谱幂律如何被非线性特征映射延展并转化为测试损失的幂律,以及数据谱幂律的有限范围如何导致性能平台期。
此外还提到 How Feature Learning Can Improve Neural Scaling Laws 与 Learning Curve Theory 两篇。
所属事件:六篇论文从理论层面解释各类Scaling Law机理(3 条相关)→
「研究」频道最新
- Kepler 在 ARC-AGI-3 全部 25 关拿服务器验证满分,总成本仅 777 美元 — rohanpaul_ai · 2026-10-04
- 研究称 6-8 个人工神经元即可模拟单个生物神经元 — aran_nayebi · 2026-10-04
- 单个神经元的计算复杂度仍是未解之谜:可能只是门控,也可能远超想象 — JoshPurtell · 2026-10-04
- Meta 开源 RankEvolve:双 agent 互审把自动实验准确率从 45.8% 提到 62.5% — dair_ai · 2026-10-04
- CMU 论文用 RL 训练 4B 提案模型改 harness 代码,反超 35B 教师 — omarsar0 · 2026-10-04
- PowerSim 开源:可微物理仿真加光线追踪渲染框架 — anand_bhattad · 2026-10-04