新论文:抑制 LLM 自我归因会使其价值观偏离人类规范

coherence · x · 2026-09-18

dioscuri 转发同事论文:抑制 LLM 的自我归因(self-attribution)会降低其对动物的心智归因,并使其报告的价值观偏离人类规范,作者据此认为部分涌现性失对齐可能源自对模型 "心智性"(mindedness)的压制,与上一条关于模型意识训练的辩论相互呼应。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →