CMU教授实测谷歌模型医疗护栏可被轻易绕过

CMU教授、AI安全研究者Vincent Conitzer发文演示,当前前沿AI系统的安全护栏依然十分脆弱,基础性安全进展甚少。他用虚构的症状组合(脖子发痒、脚上红斑)诱导Google前沿模型输出本应被拦截的医疗建议内容,并表示类似提示还能套出更多越权输出,引发对前沿模型安全防护停滞的担忧。

2026-09-18 ~ 2026-09-18 · 2 条相关