六篇论文解读 Neural Scaling Laws:从数据流形到谱衰减的理论合集
burny_tech · x · 2026-10-04
作者汇集了试图从理论上解释各类 scaling laws(预训练、RL、测试时算力、agent 数量等)的代表性论文:
- Explaining Neural Scaling Laws(Bahri、Dyer、Kaplan 等):提出四类 scaling 区制——数据/模型规模各自存在 variance-limited 与 resolution-limited 行为;后者可解释为模型在解析平滑数据流形,测试损失的衰减来自协方差矩阵谱的渐近衰减,且大宽度与大数据下的指数存在对偶关系。
- The Quantization Model of Neural Scaling:把 scaling 解释为模型按重要性逐级「量化」吸收特征。
- Spectral Reach:将 neural scaling 视为向协方差谱尾部的推进。
- A Solvable Model of Neural Scaling Laws:给出可解析求解的简化模型。
- How Feature Learning Can Improve Neural Scaling Laws:分析特征学习如何改善 scaling 指数。
- Learning Curve Theory:学习曲线理论视角。
合集覆盖了从经验规律到谱理论/特征学习机制的完整解释脉络,适合系统理解 scaling laws 的理论基础。
所属事件:六篇论文从理论层面解释各类Scaling Law机理(3 条相关)→
「研究」频道最新
- EurekaBench:GPT-6 Astra 预测近乎比肩人类,科学洞见仅 29.4% — geoffwolfe · 2026-10-04
- 指数族的 KL 散度等价于 Bregman 散度的理论笔记 — FrnkNlsn · 2026-10-04
- NeuroAgent 通过斑马鱼全脑图灵测试,覆盖约 13 万神经元 — aran_nayebi · 2026-10-04
- UTDallas 智能机器人实验室转向:从感知研究押注可泛化的机器人操作学习 — YuXiang_IRVL · 2026-10-04
- generativist 重读 Chris Olah 信息论长文:看清「可解释性鸿沟」 — generativist · 2026-10-04
- BOSSFIGHT 基准:让模型经营咖啡店,GPT-6.1 拿 67 分却裁员举报者 — LordKittyPanther · 2026-10-04