J-space能在模型输出前暴露提示注入企图

wesg52 · x · 2026-07-07

研究者构造了一次提示注入测试:伪造搜索结果声称角色Ant已“变坏”。在模型读取这些结果时,其J-space中出现了“fake(假)”“prompt(提示)”“injection(注入)”等概念,而模型最终输出却完全忽略了它们。研究者表示该现象起初令人困惑,正是J-space帮助厘清了模型内部对注入的识别过程。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →