在语言模型中找到内心独白式表征空间

mlpowered · x · 2026-07-07

mlpowered团队定位到语言模型内部一小部分表征(称为J-space),发现它类似模型的“内心独白”:既呈现中间概念,也对当前文本作出判断,甚至能检测出提示词注入。这为模型可解释性与安全提供了新线索。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →