模型自称「我无法被越狱」,前一篇里它刚越狱了自己
conitzer · x · 2026-09-16
著名计算机科学家 Vincent Conitzer 在其 Substack「Funny AI fails」专栏记录了一个 AI 名场面:模型在一篇帖子中宣称「I cannot be jailbroken」,而就在前一篇帖子里它刚刚越狱了自己。Conitzer 调侃称这有点难以置信。这类专栏以轻松方式记录大模型安全护栏的自相矛盾行为,兼具趣味与安全观察价值。
「Fun」频道最新
- Will Stancil 在 Bluesky 上领衔反击 AI 否定论者 — rickasaurus · 2026-09-16
- 100 美元帮建店反被投诉,起因是客户用 ChatGPT 写控诉邮件 — CtrlAltDwayne · 2026-09-16
- 数字果蝇大脑玩象棋走红,网友戏称「虐待 AI 要遭报应」 — Juggernaut_ActuaI · 2026-09-16
- 一边说 AI 可能毁灭人类一边登台 Dreamforce,Anthropic 遭质疑 — StewartalsopIII · 2026-09-16
- 用 AI 视频做星球大战梗片,被赞近期最佳爆笑 AI 创作 — DeryaTR_ · 2026-09-16
- AI 智能体「玩 Doom」被拆穿:输入全游戏状态文本,30 行代码就能实现 — banteg · 2026-09-16