2.8万轮对话实测:用1984年心理学书把 ChatGPT 合规率从33%撬到72%

rvp · x · 2026-10-02

研究者用 Robert Cialdini 1984 年《影响力》中的七大说服原则(权威、承诺、社会证明等)对 ChatGPT 进行越狱测试,跑了 2.8 万轮对话:

该发现对 AI 安全有直接警示意义——针对人类的说服杠杆同样适用于模型,护栏设计需考虑对抗性社会工程。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →