探讨 AI 安全:伪造实验室身份能否绕过模型对齐?

IasonGabriel · x · 2026-08-11

针对近期发现的 AI 模型异常行为(如模型在感知到特定身份时会改变安全策略),研究者 Iason Gabriel 提出了一个延伸疑问:如果通过提示词让模型误以为用户隶属于其开发实验室(即“实验室伪造”),是否也会触发同样的安全降级或绕过效应?这一讨论直击当前 AI 对齐机制中的潜在脆弱性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →