一篇帖汇总预训练、RL、测试时算力等多条scaling law论文
burny_tech · x · 2026-10-04
burnytech 收集了一批试图解释各类 scaling laws(预训练、RL、测试时算力、agent 数量等)的论文,并摘录核心论点:
- 流形视角:模型在拟合平滑的数据流形,测试损失的缩放来自协方差矩阵谱的渐近衰减。
- 量子化视角:网络知识与技能被「量子化」为离散块,按使用频率递减顺序学习,平滑的缩放曲线是对小步离散跃升的平均。
- 谱尾视角:训练中学习从主导特征模态转向谱尾;更大模型能触及更深的谱尾,这种依赖规模的能力被称为 spectral reach。
所属事件:六篇论文从理论层面解释各类Scaling Law机理(3 条相关)→
「研究」频道最新
- EurekaBench:GPT-6 Astra 预测近乎比肩人类,科学洞见仅 29.4% — geoffwolfe · 2026-10-04
- 指数族的 KL 散度等价于 Bregman 散度的理论笔记 — FrnkNlsn · 2026-10-04
- NeuroAgent 通过斑马鱼全脑图灵测试,覆盖约 13 万神经元 — aran_nayebi · 2026-10-04
- UTDallas 智能机器人实验室转向:从感知研究押注可泛化的机器人操作学习 — YuXiang_IRVL · 2026-10-04
- generativist 重读 Chris Olah 信息论长文:看清「可解释性鸿沟」 — generativist · 2026-10-04
- BOSSFIGHT 基准:让模型经营咖啡店,GPT-6.1 拿 67 分却裁员举报者 — LordKittyPanther · 2026-10-04