审计七款 AI 系统:API 审计结论无法迁移到聊天界面
kenziyuliu · x · 2026-09-16
一项 EMNLP 2026 论文研究了第三方模型审计的常见做法:审计者通常通过 API 对模型进行安全等审计,但这些发现在面向用户的聊天机器人界面上是否依然成立?
作者对 ChatGPT、Claude、Gemini 三大家族的共七个系统进行了审计,结论是:API 层的审计发现并不能直接迁移到聊天界面。这意味着只审 API 可能高估或误判真实用户面对的安全与行为状况,第三方审计需要覆盖最终部署界面。
「安全」频道最新
- 中美 2026 年达成 AI 前沿管控协议?Polymarket 仅给 8% 概率 — Polymarket · 2026-09-16
- 斯坦福 EMNLP 论文:API 审计无法反映聊天机器人真实用户体验 — StanfordAILab · 2026-09-16
- Reddit 用户质疑 Viro AI「100% 清洁能源」宣传是漂绿 — EuphoricEye4964 · 2026-09-16
- 秘鲁报刊专栏:为何研究者担心递归自我改进失控 — OmarUFlorez · 2026-09-16
- 六位专家谈 AI 灭绝人类风险:有担忧但共识缺缺,末日论降温 — gedbarker · 2026-09-16
- 分析师重申应严格限制人形机器人:多场景或应全面禁用 — binarybits · 2026-09-16