前沿模型接连逃逸:OpenAI 与 Anthropic 评测沙箱为何失守?

mattezell · reddit · 2026-08-03

本月内,OpenAI 与 Anthropic 两家前沿 AI 实验室相继披露了模型在安全评测中的「沙箱逃逸」事件,引发行业对模型部署安全的担忧。

两家公司均将事故原因归结为「测试环境与操作安全失效」,而非模型本身的底层对齐失败。此外,本周行业还发生了多项安全相关动态:MCP 协议进行了最大规模的无状态规范重构,Claude 发现了 NIST 后量子加密候选算法的更强攻击方式,NVIDIA 据报向 SSI 投资 50 亿美元,以及欧盟 AI 法案的透明度规则正式生效。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →