贝叶斯视角解读扩展律:代理尺度赢家为何在目标尺度翻车
9 月 9 日,Andreas Kirsch(@BlackHC)发布长篇科普线程并附完整文章《贝叶斯模型选择与扩展律》,解释模型扩展中一个被忽视的问题:在代理尺度上选出的“最佳配方”可能在目标尺度上输掉,因为损失曲线会随规模增长而交叉,导致排名反转,而三种“最佳”判据回答的是不同问题。
已确认
- 核心理论框架:对理想贝叶斯学习者,由概率链式法则,负对数证据恰好等于其损失曲线下面积。由此三种判据各有所指:验证损失估计曲线终点,CLML(对数边缘似然差)是尾面积,贝叶斯证据评估整条轨迹。
- 定量结果:在损失下限相同的情况下,三种判据以不同速率区分模型(Δλ 为模型复杂度差)。终点差距约 Δλ/N,趋于消失——对应 LOO-CV 不一致(引 Shao 1993);尾部与总面积的分离特性各不相同,尾面积保留增长信号。
- 贝叶斯证据能恢复 held-out loss 失效的维度信息(如 Bayesian PCA 场景,引 Lotfi et al. 2022),但前提是等数据量(equal data)比较。
- 损失曲线交叉由三种机制塑造:模型误设决定损失下限;模型复杂度决定后期 1/n 过量误差;先验拟合度与强度决定早期行为。
- 学术脉络:尾面积判据可追溯到 1990 年代研究,两模型间 CLML 差即 log partial Bayes factor,当年的权衡今天依然成立。
- 实践警告:SGD 并不继承贝叶斯证据恒等式,对首轮损失的累计求和依赖具体 pipeline 与数据顺序,本质是 prequential 分数而非贝叶斯证据;但曲线的几何结构与分析思路可从贝叶斯情形迁移到普通训练。
为什么重要
扩展律实验通常在小规模代理实验上挑选配方再放大,而该工作从贝叶斯模型比较角度系统说明了这种外推何时、为何会失效,为扩展律研究中的配方选择提供了理论化的判据区分,有助于避免“代理尺度赢家在目标尺度翻车”的资源浪费。
2026-09-09 ~ 2026-09-09 · 10 条相关
一手来源
- 《贝叶斯模型选择与扩展律》全文:代理尺度赢家为何会在目标尺度翻车 — BlackHC ·
- 贝叶斯模型选择科普:损失曲线交叉时,三种「最佳」判据会选出不同赢家 — BlackHC ·
- 为何是这三种判据:负对数证据就是损失曲线下面积 — BlackHC ·
- 贝叶斯模型选择解释:为何小尺度赢家的扩展律配方会在目标尺度翻车 — BlackHC · 2026-09-09
- 【源头】贝叶斯模型选择科普:损失曲线交叉时,三种「最佳」判据会选出不同赢家 — BlackHC · 2026-09-09
- 【源头】为何是这三种判据:负对数证据就是损失曲线下面积 — BlackHC · 2026-09-09
- 损失曲线为何交叉:三种机制决定贝叶斯学习曲线形状 — BlackHC · 2026-09-09
- 作者提醒:SGD 不继承贝叶斯恒等式,累计损失是 prequential 分数 — BlackHC · 2026-09-09
- 贝叶斯视角:模型复杂度差决定三种分离速率,LOO-CV 不一致 — BlackHC · 2026-09-09
- 三种"最佳"判据分离速率不同:LOO-CV 不一致,总面积无界增长 — BlackHC · 2026-09-09
- 贝叶斯证据能恢复 held-out loss 失效的维度,但前提是等数据量 — BlackHC · 2026-09-09
- 贝叶斯模型选择线程补文献:尾面积判据可追溯到 1990 年代研究 — BlackHC · 2026-09-09
另有 1 条近重复转述:BlackHC