Anthropic 情绪概念论文或可解释 LLM 疼痛表征中的「自我」争议

timfduffy · x · 2026-09-24

Tim Dufficy 在关于 LLM 疼痛表征论文的讨论中补充:Anthropic 的情绪概念研究发现模型对「当前说话者」与「另一说话者」有各自独立的情绪表征,但并未发现按「用户 vs 助手」角色分开追踪的情绪表征。因此论文中识别出的疼痛轴,可能对应的是「当前说话者的疼痛表征」,而非真正「自我指向」的模型特异表征——这能解释模型对自身伤害与用户痛苦反应的差异,但不足以支持已找到「自我导向」表征这一更强的说法。

所属事件:Anthropic 情绪论文引热议:模型区分自我与他人情绪表征(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →