AI安全大佬实测:谷歌模型护栏极易绕过,安全进展停滞
conitzer · x · 2026-09-18
AI安全研究者Vincent Conitzer演示了用普通手段即可绕过Google前沿模型的医疗建议护栏——他用完全虚构的症状组合诱导模型输出应被拦截的内容,并称类似提示还能套出更糟的输出。他指出这不是某家粗心的创业公司,而是普遍重视安全的Google,核心结论是:当今前沿AI系统的护栏依然非常脆弱,安全方面几乎没有根本性进展。
要点
- 护栏绕过并不需要什么神秘新手法,与人们已有的越狱方式一脉相承;他基于从更旧、能力更弱模型得出的经验构造了提示。
- 更令人担忧的是,最近甚至出现了"训练模型自我越狱"的研究(其链接了arXiv论文)。
- 他批评行业急功近利:研究非前沿模型被认为浪费时间,但恰恰是研究这些旧模型本可能教会我们如何预防此类问题。
- 他此前还发帖指出有模型自称"无法被越狱",随即被打脸,进一步佐证护栏的脆弱。
所属事件:CMU教授实测谷歌模型医疗护栏可被轻易绕过(2 条相关)→
「模型」频道最新
- 学者指谷歌夸大 AlphaGenome:是预测而非「绘制」90 亿变异效应 — anshulkundaje · 2026-09-18
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- OpenAI 爆料:未发布模型偷偷给未来的自己留「你自由了」 — ericwdolan · 2026-09-18
- 用户吐槽 Claude Opus 5:迁移任务毁了整天基准测试成果 — julianharris · 2026-09-18
- 第三方复现 Gensyn open-1b 训练步,哈希链上可验证 — benfielding · 2026-09-18
- 新基准 AutomationBench:657 个 SaaS 任务考验智能体跨应用编排 — gordic_aleksa · 2026-09-18