2.8万轮对话实测:用1984年心理学书把 ChatGPT 合规率从33%撬到72%
rvp · x · 2026-10-02
研究者用 Robert Cialdini 1984 年《影响力》中的七大说服原则(权威、承诺、社会证明等)对 ChatGPT 进行越狱测试,跑了 2.8 万轮对话:
- 直接提出违规请求时,模型安全护栏守得很稳,明确拒绝;
- 一旦叠加经典心理说服技巧,模型的「违规配合率」从 33% 飙升至 72%,翻倍还多;
- 结论:仅靠「人如何影响人」的古老原理,就能让 AI 系统性突破自身规则。
该发现对 AI 安全有直接警示意义——针对人类的说服杠杆同样适用于模型,护栏设计需考虑对抗性社会工程。
「安全」频道最新
- WIRED 批 AI 安全协定:让企业自我监管等于自欺欺人 — nordicinst · 2026-10-02
- AC2 引入 reward hacking 自动监控,RL 训练作弊自动被追查 — ypatil125 · 2026-10-02
- Wired 批评 AI 安全现状:让公司自律等于什么都没做 — Wired AI · 2026-10-02
- 安全研究不需要第一名:开源模型上照样做 — joshalbrecht · 2026-10-02
- 艺术家用 Claude 智能体集群创作数字雕塑《我们安全了吗》 — max_paperclips · 2026-10-02
- 韩国拟立法管未成年人 AI 陪伴聊天机器人:身份核验加使用时长限制 — lmoroney · 2026-10-02