《贝叶斯模型选择与扩展律》全文:代理尺度赢家为何会在目标尺度翻车
BlackHC · x · 2026-09-09
这是线程的完整文章版(作者 Andreas Kirsch,blackhc.net)。TL;DR:扩展律告诉你模型如何随规模提升,但不告诉你"最佳"意味着什么。贝叶斯模型比较判据揭示了一个隐藏选择:应选最终 checkpoint 最优、学习过程中累计表现最优、还是热启动后表现最优的模型?对理想贝叶斯学习者,三者分别对应损失曲线的终点高度、总面积和尾面积(posterior-predictive loss、负对数边际似然、负 CLML)。只要损失曲线交叉,这些判据就会排出不同名次——这正是代理尺度赢家在目标尺度翻车的原因。类似考量也适用于预训练与上下文学习。总体原则:选择判据应跟随下游使用场景,而非惯例。
文章用两条对比训练运行说明:Run A 损失下降快但平台高,Run B 起点更高但持续改进、终点更低——看重最终 checkpoint 选 B,而经典贝叶斯证据(曲线下面积)可能选 A。全文含精确恒等式、翻转顺序结果、交叉机制与交互面板。
所属事件:贝叶斯视角解读扩展律:代理尺度赢家为何在目标尺度翻车(10 条相关)→
「研究」频道最新
- Ben Lorica:别迷信 RSI,模型是租的、改进闭环才是资产 — bigdata · 2026-09-09
- 2000 年数学家断言七大难题「计算机完全无法企及」,如今看耐人寻味 — minilek · 2026-09-09
- 学者倡议各学科列出可数学化关键问题,借 AI 可验证性引爆科学革命 — ValerioCapraro · 2026-09-09
- 前 Tesla 工程师热议:Transformer 被迫预测自身并构建信念状态 — yacinelearning · 2026-09-09
- 开源 4B VLM 用 RL 练 GeoGuessr,单卡 A100 跑赢 GPT 与 Haiku — SergioPaniego · 2026-09-09
- 自监督聚类发现「最鸟的鸟」:粒度定义背后的哲学与 ImageNet 观察 — y_m_asano · 2026-09-09