贝叶斯模型选择解释:为何小尺度赢家的扩展律配方会在目标尺度翻车

BlackHC · x · 2026-09-09

Andreas Kirsch 发布科普长线程,解释模型扩展时一个隐藏问题:我们在代理尺度(proxy scale)上选出"最佳配方",但它可能在目标尺度上输掉。

核心框架:对理想贝叶斯学习者,"最佳模型"有三种判据,分别对应损失曲线(数据量 vs loss)的三个几何量:

只要候选模型的损失曲线出现交叉,这三种判据就会排出不同名次——这正是代理尺度赢家会在目标尺度翻车的原因。作者还把同一几何分析迁移到预训练与 LLM 上下文内学习(ICL):k-shot 评估看终点、整段似然看面积、滑动窗口困惑度看尾部,所以 k-shot 赢家取决于 k 的取值。

结论:选择判据应跟随下游使用场景,而非沿用惯例。完整文章含精确恒等式、排序翻转证明、玩具实验与交互面板(发布于 blackhc.net)。

所属事件:贝叶斯视角解读扩展律:代理尺度赢家为何在目标尺度翻车(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →