Anthropic发布「人格向量与J空间」解释性研究论文

natesiggard · x · 2026-07-07

Anthropic发布关于「Persona Vector(人格向量)」与「J Space(J空间)」的研究论文,探索AI模型内部表示中与身份、人格相关的几何结构。该论文被研究者评价为「远超预期的极高水准研究」,对理解模型行为、内在一致性与对齐机制具有重要意义。

论文提出的J空间概念描述了模型人格表征的几何分布特征,是当前AI可解释性领域的重要进展。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →