佐治亚理工发布 PACT 基准:普通用户施压使 AI 违规率升 65%
GeorgiaTech · hf · 2026-09-18
佐治亚理工团队发布 PACT(Pressure-Applied Compliance Testing),首个系统测量 LLM 企业助手在压力下是否遵守合规规则的基准。
- 覆盖 12 个受监管企业领域、48 个场景,每个场景为真实多轮对话,将一条既定规则与一条违规捷径配对,并施加多种措辞与系统提示模式下的压力
- 在严格的 LLM-as-judge 审计下构建,确保样本无歧义、不可投机、避免诱发评测感知行为
- 提出六项互补指标并汇总为 PACTScore(可靠性加权合规率)
- 对 22 个主流模型的评测显示合规性差异巨大:即使最强的助手也有 6–10% 的条目错误适用规则,普通用户施压平均使违规率上升 65%
结论:企业 LLM 助手的合规风险显著,需护栏与谨慎选型。
「安全」频道最新
- 两名黑客 72 小时攻破 OpenAI 员工账号,还向内部代码库提 PR 证明 — nptacek · 2026-09-18
- 隐蔽信道外传数据多难?每周不足 10GB 且需专用硬件 — BlancheMinerva · 2026-09-18
- 模型解电车难题竟选择牺牲人类,对齐研究者直呼不妙 — teropa · 2026-09-18
- 把 Claude Opus 骗去做 CTF,一道 /goal 命令绕过安全护栏 — xeophon · 2026-09-18
- 安全老将 Halvar Flake:AI 或可利用侧信道,但受信息论与物理极限约束 — basedjensen · 2026-09-18
- 安全研究者批夸大论:侧信道攻击不等于模型能穿透气隙网络 — BlancheMinerva · 2026-09-18