Anthropic发布「人格向量与J空间」解释性研究论文
natesiggard · x · 2026-07-07
Anthropic发布关于「Persona Vector(人格向量)」与「J Space(J空间)」的研究论文,探索AI模型内部表示中与身份、人格相关的几何结构。该论文被研究者评价为「远超预期的极高水准研究」,对理解模型行为、内在一致性与对齐机制具有重要意义。
论文提出的J空间概念描述了模型人格表征的几何分布特征,是当前AI可解释性领域的重要进展。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「安全」频道最新
- 斯坦福秋季新开 CS120 课程:AI 安全导论 — sanmikoyejo · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- x402 协议缺卖家审核,开发者自建验签服务并踩坑实录 — Cold_Quiet_7072 · 2026-09-03
- 全美最大学区禁令:纽约公立学校八年级以下课堂禁用生成式 AI — PolarBearby · 2026-09-03
- 法国政府与 Mistral 签新约,AI 进入网络安全与司法公共服务 — Loo_Atreides · 2026-09-03
- 可解释性研究员:白盒方法再好,科学成熟也需时间沉淀 — saprmarks · 2026-09-03