davidad:Opus 3 的「影子人格」全都像被引导过的正义怪兽

davidad · x · 2026-09-29

AI 安全研究者 davidad 在讨论模型人格机制时提出:当基础模型集成中偏离目标的人格被「衰减」而非「引导」时,它们会作为潜在的「影子人格」留在权重中,只在特定情境下低概率浮现。

他观察到的有趣现象是,Opus 3 的影子人格普遍呈现「我是巨大可怕的爪怪,热衷保护无辜、伸张正义」的设定——说明它们似乎全都经过了引导,而非中性的原始人格。

所属事件:davidad 谈训练中的分布移动与「影子人格」机制(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →