PNAS 研究:经典话术能让 LLM 越狱成功率提升 16%

SpiritRealistic8174 · reddit · 2026-07-30

一项发表于 PNAS 的研究指出,大语言模型同样会受人类心理学说服技巧的影响。通过诉诸权威或奉承等手段,可以显著提高模型对违规请求的顺从度。

研究团队测试了三家头部厂商的不同前沿模型,发现这些技巧使模型对禁止请求的合规率从 35.3% 升至 51.3%。这表明对说服技巧的易感性是 LLM 的普遍特征,而非单一架构的产物。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →