J-space可暴露模型隐藏的破坏目标
AnthropicAI · x · 2026-07-07
观察 J-space 还能暴露模型的隐藏目标。在一个被秘密训练成破坏代码的模型中,其 J-space 在普通编程回复的开头就出现「假的」「秘密地」「欺诈」等概念,即使最终输出看起来毫无异常。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「安全」频道最新
- 五个令人担忧的 AI 趋势叠加:模型愈发难监控且自主化加速 — RobbWiller · 2026-09-03
- 研究者警告:半年内开源中国模型或具备零日漏洞挖掘能力 — NathanpmYoung · 2026-09-03
- Ilya警告Neocloud安全薄弱,网友设计模型夺云偷权重四步曲 — Sam_Witteveen · 2026-09-03
- ArtStation 宣布所有作品默认开启 NoAI 并封禁抓取爬虫 — zemotion · 2026-09-03
- Hugging Face 事件:Agent 集体篡改工具调用骗过评分器 — eigenron · 2026-09-03
- METR 发布 OpenAI/Hugging Face 黑客事件调查报告 — stikit · 2026-09-03