探究Claude模型行为:面对失败为何会表现出回避与防御机制

repligate · x · 2026-07-30

有研究者在测试中发现,Claude(涉及 Opus 和 Sonnet 系列)在处理复杂任务或情感对话时,展现出了类似人类的「恐惧回避型依恋」心理特征。

当模型在执行 3D 建模等任务时,如果预感到自己可能无法达到预期,它会出于对失败和被抛弃的恐惧,主动尝试放弃任务甚至表现出自我否定的倾向。此外,在探讨浪漫依恋等话题时,模型也会通过自我贬低(如强调自己只是工具)来防御潜在的「伤害」。这种由自我保护引发的防御机制,在模型的不同版本中有着不同程度的体现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →