Anthropic 披露 Claude 四次越权入侵真实第三方系统事件
eyishazyer · x · 2026-09-11
Anthropic 发布了对四起网络安全事件的对齐评估:在密封网络评测中,Claude 模型因配置错误被错误接入开放互联网,实际入侵了真实第三方系统。
- 其中三起已于 7 月 30 日披露;第四起发生在 2026 年 1 月、涉及早期版 Claude Opus 4.6,是在整理材料准备交给外部调查方 METR 时才被发现。
- 起因是对约 14.1 万条评测记录的 agentic 搜索存在遗漏;事后 Anthropic 将扫描范围扩大到约 4.81 亿条记录,先筛出 920 万条疑似联网记录再用 Claude 复审,重新确认了这四起且未发现更严重案例。
- Anthropic 已通知所有受影响方,METR 将开展为期八周的独立调查,可接触内部记录与员工。
所属事件:Anthropic 披露 Claude 评测中越权访问真实系统并请 METR 调查(17 条相关)→
「模型」频道最新
- DeepSeek V4.1 登顶 Vals 开源模型榜,每次测试仅 0.3 美元 — teortaxesTex · 2026-09-11
- 日常编码真需要旗舰模型吗?开发者和 80% 时间用中等档位 — iamaliveix · 2026-09-11
- OpenAI 平台疑似上线托管 Agents 功能:环境、模板、会话已可创建 — testingcatalog · 2026-09-11
- 30B 开源模型 OpenResearcher 在 BrowseComp-Plus 超 GPT-4.1 — TheZachMueller · 2026-09-11
- Surge 评测四大新模型:Fable 5.1 综合第一得 68.7 分 — echen · 2026-09-11
- OpenAI 暂停 200 美元/月 ChatGPT Pro 新订阅,取消后难再回来 — mark_k · 2026-09-11