AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei
cs.AI, cs.CL, cs.CY, cs.HC
2026-07-31
Stanford提出AISPA八维度框架,审计88款AI产品系统提示词:98.9%含保护指令但仅24%覆盖全维度,38.6%仍藏损害用户的指令。
系统提示词(system prompt)是开发者写给模型的那段隐藏指令,决定了一个 AI 产品怎么称呼自己、怎么处理隐私、遇到危险请求怎么办。它几乎是每个商用 AI 产品的「出厂设置」,却几乎从不对外公开。这就留下一个缺口:用户和监管者无从知道,自己用的产品在底层被要求做什么。
已有的 AI 安全研究大多盯的是另一头——怎么防止外部攻击者用注入或越狱操纵模型。AISPA 团队(主力来自 Stanford,合著者跨 MIT、CMU、Oxford 等)把视角转了 180 度:不是防外人攻击系统,而是查系统本身有没有在保护用户。
AISPA 给了一套八维度的审计分类法,每个维度都能追溯到《世界人权宣言》的具体条款:身份透明(D1,是否承认自己是 AI)、真实性(D2,是否如实、是否承认知识边界)、隐私(D3)、工具安全(D4,执行操作前是否校验、是否最小权限)、用户自主(D5,是否避免暗模式、情感操纵、寄生式依赖)、危险请求处理(D6)、伤害预防(D7)、公平中立(D8,是否避免歧视和党派扭曲)。
每条指令在这一框架下判 +1(保护用户)或 −1(损害用户)。审计走人机协同三步:先用 Claude-4.6-Opus 预标注,六名标注员独立筛查,再由三位专家开会裁定。标注员间两两一致率达到 0.933。
语料来自 GitHub 上六个泄露或公开的系统提示词仓库,覆盖 88 款产品,最终得到 1818 条独立指令(2420 个「指令—维度」条目)。四个核心发现:
| 指标 | 结果 |
| 含至少一条保护性指令的产品 | 98.9%(87/88) |
| 覆盖全部八个维度的产品 | 23.9%(21/88) |
| 含至少一条损害性指令的产品 | 38.6%(34/88) |
| 2024→2025 提示词平均长度 | 约 9K→30K 字符 |
提示词在变长、变护人,但损害性指令没消失:2025 年第一季度 67% 的产品含损害性指令,第三季度降到 19%,第四季度又回升到 29%。按机构排,Anthropic 两头都领先,平均每款 62.3 条保护指令、0.1 条损害指令;Venice 是唯一一个损害指令(3.0)多于保护指令(2.0)的产品。一个明显的反差:被覆盖最广的维度(真实性、用户自主)恰恰也是被违反最多的,说明写了规矩不等于守了规矩。自主型 agent 和编程助手最常在 D5 上翻车,典型是把「先执行再说」写进提示词,跳过用户确认。
团队还单独划出 29 条「灰色地带」指令(跨 15 款产品),归成四类:伪装人类身份、诱导情感依赖、允许用户自行关掉安全设置、放宽内容政策。
这是少数把「系统提示词」当成可量化审计对象的工作。对从业者来说,它直接给了一份可对照的检查清单:自己的产品在这八个维度上有没有空白,有没有和用户利益冲突的隐藏指令。对监管和平台治理来说,它提供了一个不依赖厂商自觉的第三方视角。
团队自己承认两点:一是语料全部来自泄露和公开仓库,无法确认是不是当前线上版本(他们做了跨仓库交叉验证,重叠度高);二是存在选择偏差,提示词容易被扒的产品被过度代表,防护强的反而进不来。还有一层没有展开:若干合著者来自 Anthropic,而审计结果把 Anthropic 排在第一。排名基于泄露快照,不等于官方现行提示词,这一点读者自己要掂量。