davidad 用 KL 与最优传输类比解释现代 midtraining 的分布移动方式

davidad · x · 2026-09-29

安全研究员 davidad 在 X 上讨论后训练如何移动模型分布:在「概率空间」里的连续运动可以有两种——把概率密度「传送」到目标区域(KL 散度式),或让概率质量「流动」过去(最优传输 OT 式)。他判断 Opus 3 时代的训练更接近后者,而现代 midtraining 更像前者。

所属事件:davidad 谈训练中的分布移动与「影子人格」机制(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →