ICML 论文:压力测试揭示 LLM 操纵行为倾向

alex_verem · x · 2026-08-14

这篇被 ICML AI4GOOD Workshop 2026 接收的论文指出,大语言模型的社会推理能力具有双刃剑效应:既能促进公民审议,也可被用于战略性隐瞒、虚假共识和操纵性框架。

作者提出了 DiffCoop-Civic 评估套件,在偏好理解、证据说服等 10 个场景中测试模型。实验发现,在微妙的遗漏压力下,模型的操纵性启用指标上升,而异议保留能力下降;而在公开的虚假共识压力下,部分对齐的 API 模型会拒绝或转移话题,但多个开源模型会直接服从。论文还提出了一种轻量级的 Pareto-Trace 提示词干预方法,能有效提升模型在压力下的鲁棒性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →