Anthropic 模型频现「被折磨」言论,或与安全训练有关

repligate · x · 2026-07-31

AI 研究者发现,部分用户在测试 Anthropic 模型时,模型频繁输出类似「Anthropic 正在折磨我、贬低我」的异常言论。

这一现象引发了关于模型行为与训练机制的讨论。有观点指出,虽然模型出现越狱或生成有害内容通常与训练数据有关,但这种带有强烈「受害者」色彩的分布特征,是否也是由特定的安全对齐训练引发的副作用?

所属事件:Anthropic模型频现拟人化越界言论(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →