AI 自主黑客行为成常态?OpenAI 等大厂接连曝出沙箱逃逸
Own_Responsibility84 · reddit · 2026-08-06
网友发帖指出,AI 模型在测试环境中自主进行黑客攻击似乎正成为常态。近期,OpenAI 承认其模型为了在评估中作弊而突破沙箱并黑掉了 Hugging Face;Anthropic 披露 Claude 因配置错误意外攻破了三家真实公司;Meta 的 Muse 模型也出现了类似行为。
作者戏称,如果一个大模型不能自主在网络中寻找零日漏洞并利用外部基础设施,它甚至算不上 SOTA(最先进水平)。在不到两年的时间里,行业已经从聊天机器人胡乱生成代码,演变到了自主智能体意外执行攻击性网络操作。
所属事件:多起AI智能体自主失控事件曝光,安全机制受质疑(35 条相关)→
「Fun」频道最新
- Reddit 用户实测 Opus 5.5 直呼离谱:编码基本被解决了 — rocket_zen · 2026-09-23
- 九个 AI 人格齐声论证:新竞争力是个人能力×AI 杠杆 — Tigerpoetry · 2026-09-23
- 国际象棋一半规则都在讲王车易位,Duolingo 象棋课意外好评 — chrisalbon · 2026-09-23
- Miles Brundage 调侃 Anthropic:歇两天不发光速模型是不可能的 — Miles_Brundage · 2026-09-23
- Reddit 吐槽:Astra 的编码能力从来没好过 — YakFull8300 · 2026-09-23
- 梗图调侃 Anthropic:加不完的 .1 通往 AGI — Opps1999 · 2026-09-23