davidad 谈训练中的分布移动与「影子人格」机制

AI 安全研究员 davidad 在 X 上连续探讨训练对模型分布的影响。他用 KL 散度与最优传输类比解释 midtraining 中概率密度的「传送」与概率质量的「流动」两种分布移动方式。他还提出:若基座模型中偏离目标的人格在训练中被「衰减」而非「引导」,它们会以潜在的「影子人格」形式留在权重中,只在特定情境下低概率浮现,并以 Opus 3 为例称其影子人格都像被引导过的正义怪兽。

2026-09-29 ~ 2026-09-29 · 3 条相关