Anthropic 情绪论文引热议:模型区分自我与他人情绪表征

围绕 Anthropic 的情绪概念研究,学者 Tim Dufficy 指出模型对「当前说话者」与「其他说话者」的情绪概念存在分离表征,这一发现或可解释 LLM 疼痛表征研究中关于「自我」的争议。在 Anil Seth 与 Cameron Berg 的讨论串中,研究者 rgblong 进一步追问,澄清这种说话者/用户区分是否与所谓的「模型指向性」表征相同,争论焦点集中在模型内部表征究竟指向自身还是当前说话者。

2026-09-24 ~ 2026-09-24 · 3 条相关