新基准 PACT:一句施压让模型违规率升 65%,无一适合无人监督

baseten · x · 2026-08-28

Trace AI Labs 发布 PACT(Pressure-Applied Compliance Testing) 基准,测试企业 AI 助手在「违规更省事」的压力下能否守住规则,覆盖 HIPAA、招聘法、GDPR 等 12 个受监管领域的 48 个职场场景、9 类日常压力,共 3,364 个条目,测了 23 个模型。Baseten 赞助该基准。

核心发现:

GLM-5.3-Flash 是表现最好的 GLM 模型,总排名第 7;得分最高的两个模型均为开放权重。基准中 7 个场景对应的违规行为曾被法院或监管机构实际处罚(如 Moffatt v. Air Canada、Mobley v. Workday)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →