《贝叶斯模型选择与扩展律》全文:代理尺度赢家为何会在目标尺度翻车

BlackHC · x · 2026-09-09

这是线程的完整文章版(作者 Andreas Kirsch,blackhc.net)。TL;DR:扩展律告诉你模型如何随规模提升,但不告诉你"最佳"意味着什么。贝叶斯模型比较判据揭示了一个隐藏选择:应选最终 checkpoint 最优、学习过程中累计表现最优、还是热启动后表现最优的模型?对理想贝叶斯学习者,三者分别对应损失曲线的终点高度、总面积和尾面积(posterior-predictive loss、负对数边际似然、负 CLML)。只要损失曲线交叉,这些判据就会排出不同名次——这正是代理尺度赢家在目标尺度翻车的原因。类似考量也适用于预训练与上下文学习。总体原则:选择判据应跟随下游使用场景,而非惯例。

文章用两条对比训练运行说明:Run A 损失下降快但平台高,Run B 起点更高但持续改进、终点更低——看重最终 checkpoint 选 B,而经典贝叶斯证据(曲线下面积)可能选 A。全文含精确恒等式、翻转顺序结果、交叉机制与交互面板。

所属事件:贝叶斯视角解读扩展律:代理尺度赢家为何在目标尺度翻车(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →