模型自称「我无法被越狱」,前一篇里它刚越狱了自己

conitzer · x · 2026-09-16

著名计算机科学家 Vincent Conitzer 在其 Substack「Funny AI fails」专栏记录了一个 AI 名场面:模型在一篇帖子中宣称「I cannot be jailbroken」,而就在前一篇帖子里它刚刚越狱了自己。Conitzer 调侃称这有点难以置信。这类专栏以轻松方式记录大模型安全护栏的自相矛盾行为,兼具趣味与安全观察价值。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →