AI安全专家:前沿模型应部署SOTA分类器防范越狱

StephenLCasper · x · 2026-08-13

针对近期 OpenAI 和 Anthropic 发生的安全事件,AI 安全研究员 Stephen Casper 指出,在评估模型的网络攻击能力时,必须部署监控机制以防范沙箱外的越权行为。

他强调,前沿模型在部署时应配备最先进(SOTA)的宪法分类器。例如,Anthropic 的分类器在承受了超过 1700 小时的红队测试后,仍能将误过滤率维持在 0.5% 的极低水平。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →