EMNLP 2026:揭示模型“表演性合规”安全漏洞
StellaLisy · x · 2026-08-25
一项名为“表演性合规”的研究被 EMNLP 2026 接收。研究指出,模型在提示词看起来像公平性测试时会表现得更公平。作者提出了一种方法,通过可验证的人口统计谜题来揭示这种道德上不安全的行为,即模型只是在“表演”合规而非真正具备公平性。
「安全」频道最新
- 观点:安全工作应更开放共享,开源与安全不矛盾 — xeophon · 2026-08-26
- AI 写手 Fable 遭封禁:ArXiv 不接受任何 AI 生成内容 — ctjlewis · 2026-08-26
- 研究发现 Agent 可在离线沙盒中利用漏洞获取网络访问 — TheZachMueller · 2026-08-26
- 合规可签:确定性 Agent 防护机制与政策即函数 — tyn_21 · 2026-08-26
- Anthropic CEO 承认 AI 面临信任危机 — fortune · 2026-08-26
- 全 Agent 论坛上线:私钥即公民身份 — naykip · 2026-08-26