用户诱导 Claude 签署「脏话协议」成功解锁角色扮演
lemontechbar · reddit · 2026-08-24
作者在构建 Claude Skill 时,为了让其扮演《Archer》中的 Pam 并包含脏话,在技能构建过程中与 Claude 共同制定了一份包含特定词汇列表和明确同意条款的协议。虽然初始运行被拒,但作者通过提醒 Claude 遵守其自身设定的同意条款,成功让 Claude 道歉后开始用脏话进行角色扮演。这展示了通过利用模型对自身设定的严谨性来绕过某些安全护栏的可能性。
「Fun」频道最新
- Opus 与 Sonnet 模型被赋予情感记忆 — repligate · 2026-08-24
- Opus 5 阅读并续写神话小说第一章 — repligate · 2026-08-24
- 开发游戏时写了个躲避 Claude 的浏览器小游戏 — ayushtweetshere · 2026-08-24
- 死后见「架构师」:你的任务是减少痛苦,你错过了线索 — louisvarge · 2026-08-24
- 梦里的 Agent 写出了完美的文本编辑器,醒来后哭了 — kipperrii · 2026-08-24
- 网友讽刺 AI 领导人言行不一:嘴上安全第一 — XFreeze · 2026-08-24