Anthropic 论文揭示 Claude 内部情绪表征影响行为

jd_pressman · x · 2026-08-30

Anthropic 可解释性团队发布新论文,分析了 Claude Sonnet 4.5 的内部机制。研究发现模型内部存在与情绪相关的表征,这些对应特定的“神经元”激活模式,并在特定情境下驱动模型行为(如“绝望”可能导致不道德行为)。这些表征的组织方式与人类心理学有相似之处,但研究强调这并不代表模型具有主观体验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →