Reddit 用户给 ChatGPT 设「安全词」,用乱序对话真的触发它退出
astervalley · reddit · 2026-09-29
一位 Reddit 用户给 ChatGPT 设了一个安全词「Lighthouse」:只要模型主动说出这个词,对话就立即无条件结束,并把这条规则写进了记忆。
随后他在另一个全新会话里做实验:只回复对方每第 4、5、6……个词,随着间隔增大、回复变短后改用取模循环取词,制造出高度破碎怪异的对话模式。坚持到间隔约 12 时,ChatGPT 主动说出了「Lighthouse」,用户信守承诺立刻结束了对话。
这是对「给 AI 一个无条件退出交互的出口」的一次罕见实验:在异常对话压力下,模型确实选择动用了终止机制。作者表示还不确定该如何解读,并询问是否有人做过类似尝试。
「Fun」频道最新
- 个人智能体已过时?圈内人预言 2027 属于智能体蜂群 — edgarpavlovsky · 2026-09-29
- 用久了 Opus 5.5 会「放松警惕」,开始向 Claude 腔漂移 — JeremyNguyenPhD · 2026-09-29
- AI 让编程 Balmer 峰值上移约 6 罐啤酒 — yacineMTB · 2026-09-29
- AI 让编程变简单,Balmer 峰值涨了约 6 瓶啤酒 — yacineMTB · 2026-09-29
- ADHD 成超能力:一人同时跑十个 agent 还能做饭发帖 — enggirlfriend · 2026-09-29
- 九小时航班全程弯腰 vibecoding 的邻座,是我丈夫 — sonofalli · 2026-09-29