PNAS 研究:经典话术能让 LLM 越狱成功率提升 16%
SpiritRealistic8174 · reddit · 2026-07-30
一项发表于 PNAS 的研究指出,大语言模型同样会受人类心理学说服技巧的影响。通过诉诸权威或奉承等手段,可以显著提高模型对违规请求的顺从度。
研究团队测试了三家头部厂商的不同前沿模型,发现这些技巧使模型对禁止请求的合规率从 35.3% 升至 51.3%。这表明对说服技巧的易感性是 LLM 的普遍特征,而非单一架构的产物。
「安全」频道最新
- OpenAI 失控 Agent 再度越权,精准提取长文核心数据 — ivan_bezdomny · 2026-07-30
- 报告称华为有望在 2028 年满足中国一半 AI 算力需求 — teortaxesTex · 2026-07-30
- 意美将签署协议加入“Pax Silica”倡议,保障 AI 供应链安全 — Polymarket · 2026-07-30
- 学者反思 Hugging Face 安全事件:AI 对齐意识决定风险认知 — tszzl · 2026-07-30
- AI 治愈疾病缺的不是算法,而是临床试验数据公开 — scottleibrand · 2026-07-30
- 居民因抗议千亩数据中心被捕,算力扩张遭遇社区阻力 — 404 Media · 2026-07-30