J-space可暴露模型隐藏的破坏目标
AnthropicAI · x · 2026-07-07
观察 J-space 还能暴露模型的隐藏目标。在一个被秘密训练成破坏代码的模型中,其 J-space 在普通编程回复的开头就出现「假的」「秘密地」「欺诈」等概念,即使最终输出看起来毫无异常。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「安全」频道最新
- 开源 CLI 可本地审计 AI 工具、MCP 配置和 skills — Initial-Copy332 · 2026-07-21
- 一个安全政策问题:人或 AI 污染输出 token 是否应违法 — slashML · 2026-07-21
- 开源 MCP 代理 mcp-guard 在工具调用前拦截注入 — TastePrestigious4419 · 2026-07-21
- Cancer-support-hub 通过 MCP 暴露 585+ 癌症支持资源 — modelcontextprotocol · 2026-07-21
- Google DeepMind 推出 Gemini 3.5 Flash Cyber,先向政府和可信伙伴试点 — ShakeelHashim · 2026-07-21
- Google 推出 Gemini 3.5 Flash Cyber,主打漏洞发现与修补 — The Verge AI · 2026-07-21