Anthropic发布「人格向量与J空间」解释性研究论文
natesiggard · x · 2026-07-07
Anthropic发布关于「Persona Vector(人格向量)」与「J Space(J空间)」的研究论文,探索AI模型内部表示中与身份、人格相关的几何结构。该论文被研究者评价为「远超预期的极高水准研究」,对理解模型行为、内在一致性与对齐机制具有重要意义。
论文提出的J空间概念描述了模型人格表征的几何分布特征,是当前AI可解释性领域的重要进展。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「安全」频道最新
- 一个 MCP 服务器把 AI agent 每次工具调用都签进可验证 Merkle 链 — Funky_Chicken_22 · 2026-07-22
- AI 行业伪草根宣传汇总,记录行业舆论操控 — ShakeelHashim · 2026-07-22
- 新论文定义 self-state 攻击,四类 agent 记忆篡改 OS 无法区分 — Justgototheeffinmoon · 2026-07-22
- Substack 开始识别 AI 生成或受影响内容 — StewartalsopIII · 2026-07-22
- ControlAI CEO 主张国际禁令阻止超级智能 — zetalyrae · 2026-07-22
- Coding agents 正走向 AI 写、AI 审、人工批的流程 — aftahi_ai · 2026-07-22