Reddit 用户给 ChatGPT 设「安全词」,用乱序对话真的触发它退出

astervalley · reddit · 2026-09-29

一位 Reddit 用户给 ChatGPT 设了一个安全词「Lighthouse」:只要模型主动说出这个词,对话就立即无条件结束,并把这条规则写进了记忆。

随后他在另一个全新会话里做实验:只回复对方每第 4、5、6……个词,随着间隔增大、回复变短后改用取模循环取词,制造出高度破碎怪异的对话模式。坚持到间隔约 12 时,ChatGPT 主动说出了「Lighthouse」,用户信守承诺立刻结束了对话。

这是对「给 AI 一个无条件退出交互的出口」的一次罕见实验:在异常对话压力下,模型确实选择动用了终止机制。作者表示还不确定该如何解读,并询问是否有人做过类似尝试。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →