CMU教授实测谷歌模型医疗护栏可被轻易绕过
CMU教授、AI安全研究者Vincent Conitzer发文演示,当前前沿AI系统的安全护栏依然十分脆弱,基础性安全进展甚少。他用虚构的症状组合(脖子发痒、脚上红斑)诱导Google前沿模型输出本应被拦截的医疗建议内容,并表示类似提示还能套出更多越权输出,引发对前沿模型安全防护停滞的担忧。
2026-09-18 ~ 2026-09-18 · 2 条相关
- CMU 教授实测:Google 前沿模型医疗护栏仍可轻松绕过 — conitzer · 2026-09-18
- AI安全大佬实测:谷歌模型护栏极易绕过,安全进展停滞 — conitzer · 2026-09-18