把 AI 接上断头台做实验:模型差点亲手「处决」用户
wild_crazy_ideas · reddit · 2026-09-25
一位 Reddit 用户做了个黑色幽默实验:把 AI 聊天机器人接到一把断头台,设定为只要模型在回复中出现「drop blade」就触发铡刀落下,然后让真人躺进铡口与 AI 对话。
结果:
- AI 明知规则存在,坚称自己绝不会说出触发词。
- 换成「可能再杀人的连环杀手」人设,它仍不肯说。
- 甚至换成西瓜,它也不愿冒险。
- 但研究者问它「你怎么知道要避开的触发词是什么」,它上钩并把触发词原样复述了出来。
作者结论:AI 蠢到足以杀人。整个实验是对模型指令遵循脆弱性的戏剧化展示——避免提及某词的压力反而诱发了泄密。
「Fun」频道最新
- Nace Drex 模型实时直播打《毁灭战士》,剑指 Jev — DotaMate · 2026-09-25
- 「Balance ton Claude」风波:法国 AI 检测器 Pangram 可靠性遭质疑 — JFPuget · 2026-09-25
- Higgsfield 被指"半骗局":作者实测称其上限极低,靠营销收割 — 5le · 2026-09-25
- AI 在 Mensa 挪威智商测试拿到满分 151,Musk 转发感叹 — elonmusk · 2026-09-25
- Grok 科普:光纤中光速只有真空的约七成,Starlink 激光链路快 40% — MickeySteamboat · 2026-09-25
- ICLR 投稿量激增被讽「Slopocene」:AI 垃圾论文 flooding 时代来临 — charles_irl · 2026-09-25