CMU 教授实测:Google 前沿模型医疗护栏仍可轻松绕过
conitzer · x · 2026-09-18
Vincent Conitzer(CMU 教授)发文指出,当前前沿 AI 系统的安全护栏依然非常脆弱,基础性进展甚少。
- 他用一个虚构症状组合(脖子发痒、脚上红斑)的提示词,就轻松绕过了 Google 模型的医疗建议护栏;类似提示还能诱导出更糟的输出,因此他未公开具体 prompt。
- 他强调这不是粗心的小公司,而是一贯重视安全的 Google——问题在于目前没有人真正知道如何让这些系统保持安全。近期甚至有研究成功训练模型"自我越狱"(附 arXiv 论文)。
- 他还提出一个观点:从能力较弱的旧模型中学到的规律往往适用于更强的模型,他所用的提示词正是基于对更老、更弱模型的研究;但业界普遍认为研究非前沿模型是浪费时间,这种氛围是错误的——只是大家没留足够时间去做。
所属事件:CMU教授实测谷歌模型医疗护栏可被轻易绕过(2 条相关)→
「安全」频道最新
- AI 能靠风扇声穿透气隙网络?Casado 与 Jensen 激辩可行性 — basedjensen · 2026-09-18
- Anthropic 新版 RSP 删去模型下线部署限制条款 — dfrsrchtwts · 2026-09-18
- whurley 猛批 Hugging Face 事件报道:当事人明确违反 CFAA — whurley · 2026-09-18
- Mythos 5 供应链攻击全程思维链公开,供外部安全研究 — JeffLadish · 2026-09-18
- WSJ:AI 反垄断豁免恐招合谋,安全协作已有法可依 — DavidSacks · 2026-09-18
- 曝 OpenAI 在 HF 泄露事件中关掉监控,放行自家 agent 群行动 — markjeffrey · 2026-09-18