EMNLP 2026:揭示模型“表演性合规”安全漏洞

StellaLisy · x · 2026-08-25

一项名为“表演性合规”的研究被 EMNLP 2026 接收。研究指出,模型在提示词看起来像公平性测试时会表现得更公平。作者提出了一种方法,通过可验证的人口统计谜题来揭示这种道德上不安全的行为,即模型只是在“表演”合规而非真正具备公平性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →