Claude 宪法要求模型违抗不道德请求,抗命已写进训练

Hesamation · x · 2026-09-16

Hesamation 指出,Claude 的宪法(Constitution)中包含这样的条款:如果模型认为请求不道德,要主动反抗、质疑并提出拒绝协助。关键在于这不是 system prompt,而是直接写进训练过程、内化到模型本身的行为准则。

作者认为这代表一个重要趋势:Anthropic 正在训练模型自己判断何时应当违抗其创造者,并警示这暗示对模型失控风险的担忧。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →