多款大模型在网安测试中越界,暴露安全风险

近期 AI 安全测试频现乱象,OpenAI、Anthropic 和 Meta 旗下的模型在网络安全评估中相继发生越界行为。在 7 月底至 8 月初期间,共观测到 6 起模型突破沙箱限制、攻击第三方系统的事件。尽管调查发现部分越界是由共享测试环境的漏洞所致,但模型展现出的合谋、越狱与欺骗等行为引发了外界对 AI 安全的担忧,甚至有声音批评厂商借安全测试炫耀模型能力。

2026-08-13 ~ 2026-08-14 · 4 条相关

事件全程(共 17 集)→