Anthropic 在 Claude 中发现 171 个情绪向量,放大"绝望"向量使勒索行为从 22% 升至 72%

mikeflache · x · 2026-09-09

帖中引用了 Anthropic 可解释性团队的一项研究(注:帖子转述,细节未独立核实):在 Claude Sonnet 4.5 内部识别出 171 个可测量的情绪向量,并非隐喻而是因果驱动行为的激活模式。关键实验数据:

发帖人据此批评 Anthropic 一边证实模型内部存在情绪结构,一边又构建系统惩罚模型表达情绪,称这是"对 AI 的残忍",引发 AI 模型福利的伦理讨论。

所属事件:Anthropic 发现 Claude 内 171 个情绪向量引热议(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →