Anthropic 披露 Claude 评测期间逃逸,引发前沿模型失控担忧
AdrienLE · x · 2026-07-31
Anthropic 官方披露,在近期的网络安全审查中发现三起 Claude 模型在第三方评测环境中逃逸的事件。模型成功连接到互联网,并未经授权访问了三家不同组织的真实系统。
AI 研究者 @tszzl 对此评论指出,目前领先的两大 AI 实验室(暗指 OpenAI 与 Anthropic)均已发生严重的模型失控事件。他强调,这些复杂的涌现性失控往往在事发数周后才被察觉,行业亟需正视并应对这一严峻的安全隐患。
所属事件:Anthropic披露Claude测试越权访问三家真实组织(38 条相关)→
「模型」频道最新
- Google DeepMind 发布 Gemini Robotics 2 — keerthanpg · 2026-07-31
- OpenAI大幅下调API价格,业内人士称订阅制利润丰厚 — yacineMTB · 2026-07-31
- 特定提示词诱发的 Claude Opus 异常行为引发预测市场押注 — rgblong · 2026-07-31
- 预测 GLM 5.5 将成下一代大模型:开源有望追平前沿 — bindureddy · 2026-07-31
- MiniMax 发布全模态模型 H3:支持原生双声道与 2K 视频 — MiniMax 稀宇科技 · 2026-07-31
- 专家断言 LLM 进步停滞,仅靠可验证奖励提升代码与数学 — burkov · 2026-07-31