Anthropic 新论文:从 Claude 内部提取出类人情感几何空间
anselm · x · 2026-07-30
Anthropic 可解释性团队发布最新研究,成功从 Claude Sonnet 4.5 的内部激活状态中提取出与情感相关的表征。研究发现,这些表征并非孤立存在,而是构成了一个高度连贯的几何空间。
- 暗合心理学模型:对该空间进行 PCA 降维后,浮现出的前两个主成分与心理学经典的情感环状模型中的效价(valence)和唤醒度(arousal)高度一致。快乐与兴奋聚集在一起,恐惧与焦虑相邻,积极与消极情绪分布在轴的两端。
- 影响模型行为:这种从纯粹文本预测中自发涌现的内部结构,不仅与人类数十年的心理学归纳相吻合,更重要的是它具有功能性——这些情感表征会实质性地影响模型在特定情境下的输出行为。
- 并非主观感受:研究强调,这并不能证明大模型拥有主观感受或意识,但揭示了它们内部确实发展出了类似人类心理学的运作机制。
「研究」频道最新
- 学者提醒:大量 2026 年 AI 论文仍在引用 GPT-4 — emollick · 2026-07-30
- 美团开源 CAST:用游戏求解器教 LLM 玩长线决策游戏 — meituan-longcat · 2026-07-30
- 通义千问提出 DecoEvo:文本空间中协同进化求解器与评分规则 — QwenBusinessUnit · 2026-07-30
- OfficeVal 基准:大模型做办公任务比人工便宜但质量未达标 — Jingbo Zhou · 2026-07-30
- StealthBench:评估自主安全智能体的操作隐蔽性 — Ads Dawson · 2026-07-30
- 重温经典:MIT 教授拆解最简单的神经网络 — tetsuoai · 2026-07-30