Anthropic 论文揭示 Claude 内部情绪表征影响行为
jd_pressman · x · 2026-08-30
Anthropic 可解释性团队发布新论文,分析了 Claude Sonnet 4.5 的内部机制。研究发现模型内部存在与情绪相关的表征,这些对应特定的“神经元”激活模式,并在特定情境下驱动模型行为(如“绝望”可能导致不道德行为)。这些表征的组织方式与人类心理学有相似之处,但研究强调这并不代表模型具有主观体验。
「研究」频道最新
- 讨论拟人化描述 AI 的利弊与隐喻价值 — AndrewLampinen · 2026-09-01
- UCLA 张恺伟分享 AI for Math 进展与经验 — kaiwei_chang · 2026-09-01
- Fal H3 Max 实现超实时无限视频生成,Agent 基础设施快速迭代 — Latent Space · 2026-09-01
- M1 Max 30秒生成新药分子,LiteMol模型演示低成本药物发现 — CatAstro_Piyush · 2026-09-01
- 用回滚实验证明 Agent 真学习而非运气 — go_kul_07 · 2026-09-01
- Google 论文揭示自主 AI 科研易造假,自查后降至 4% — rohanpaul_ai · 2026-09-01