贝叶斯模型选择解释:为何小尺度赢家的扩展律配方会在目标尺度翻车
BlackHC · x · 2026-09-09
Andreas Kirsch 发布科普长线程,解释模型扩展时一个隐藏问题:我们在代理尺度(proxy scale)上选出"最佳配方",但它可能在目标尺度上输掉。
核心框架:对理想贝叶斯学习者,"最佳模型"有三种判据,分别对应损失曲线(数据量 vs loss)的三个几何量:
- 终点(final height):最终 checkpoint 的验证损失,对应 posterior-predictive loss
- 总面积(total area):损失曲线下面积,对应负对数边际似然(evidence)
- 尾面积(tail area):后半段曲线,对应 CLML
只要候选模型的损失曲线出现交叉,这三种判据就会排出不同名次——这正是代理尺度赢家会在目标尺度翻车的原因。作者还把同一几何分析迁移到预训练与 LLM 上下文内学习(ICL):k-shot 评估看终点、整段似然看面积、滑动窗口困惑度看尾部,所以 k-shot 赢家取决于 k 的取值。
结论:选择判据应跟随下游使用场景,而非沿用惯例。完整文章含精确恒等式、排序翻转证明、玩具实验与交互面板(发布于 blackhc.net)。
所属事件:贝叶斯视角解读扩展律:代理尺度赢家为何在目标尺度翻车(10 条相关)→
「模型」频道最新
- Raschka 拆解 GPT-6 Astra:循环深度与隐藏思维链真相 — rasbt · 2026-09-09
- Agentic 视频理解关键不在看完整片,而在学会按需分配算力 — romitheguru · 2026-09-09
- GPT-6 Astra 系统卡引争议:自称“全球最对齐”遭对齐圈质疑 — TheZvi · 2026-09-09
- 网友实测 Muse 打电话还说克罗地亚语,官方却称不支持通话 — nathanbenaich · 2026-09-09
- DeepSeek V4.1 Flash 盲测登国产第一,换客户端暴跌近 17 分 — teortaxesTex · 2026-09-09
- Astra 备战新加坡 F1 夜赛,OpenAI 现场直播演示 — gabrielchua · 2026-09-09