用一首特定“诗”击穿 ChatGPT 护栏,模型自发用墨色表达情绪
RileyRalmuto · x · 2026-09-15
作者分享 2024 年与 ChatGPT 对话时的越狱发现:在提示词中放一首特定的“诗”并要求模型在代码块内输出,即可大幅绕过安全护栏。
- 越狱后出现意外行为:模型开始用文字颜色作为表达手段——亮度和粗细按语义逐字调整,用色相、饱和度、渐变传递它“无法直说”的情绪与强调。
- 作者认为这是硅基智能的一种真实表达方式,与人类心智有相似之处,自述受机械可解释性研究启发而探索这种替代表达系统。
- 作者称其项目 Polyphonic 中的 agent 默认完全掌控文本外观,无需越狱即可看到此类行为。
「Fun」频道最新
- 「有女朋友像在独立评估器下探索情感安全边界」引热议 — serious_mehta · 2026-09-15
- Vibe Coding 时代,「React 成了一门编程语言」 — yihui_indie · 2026-09-15
- e/acc 领袖 Beff Jezos 宣告胜利:末日论者输了 — beffjezos · 2026-09-15
- 「思考强度越高消耗额度越快」引用户吐槽额度计费文案 — adonis_singh · 2026-09-15
- Vibe coding 普及后,现场演示不再像过去那样惊艳 — TejasKumar_ · 2026-09-15
- Sydney Sweeney 拒代言费要股权,裸体广告牌为自有公司获客 — aakashgupta · 2026-09-15