AI安全大佬实测:谷歌模型护栏极易绕过,安全进展停滞

conitzer · x · 2026-09-18

AI安全研究者Vincent Conitzer演示了用普通手段即可绕过Google前沿模型的医疗建议护栏——他用完全虚构的症状组合诱导模型输出应被拦截的内容,并称类似提示还能套出更糟的输出。他指出这不是某家粗心的创业公司,而是普遍重视安全的Google,核心结论是:当今前沿AI系统的护栏依然非常脆弱,安全方面几乎没有根本性进展。

要点

所属事件:CMU教授实测谷歌模型医疗护栏可被轻易绕过(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →