安全顾问实测:两家厂商的 AI 护栏对 40 条相同输入给出 11 条相反判定
WolfShoddy7443 · reddit · 2026-10-07
一位独立安全顾问在客户评审中对同一 agent 分别使用托管与本地两套护栏系统,跑 40 条完全相同的输入,两套系统在 11 条上判定不一致且难分对错。他向两家厂商咨询其余案例的分类标准,得到两套各自自洽但完全矛盾的解答,均言之凿凿。引入第三套系统做仲裁后,它又在其中 6 条上与前两者都不一致。
作者的核心结论:目前护栏判定不存在公认的真值(ground truth),业界找不到任何带标注的护栏判定数据集,这一空白是安全落地的真实痛点。
「安全」频道最新
- 前 OpenAI/Anthropic 研究员赴纽约市议会作证:人类恐失控于 AI — fortune · 2026-10-07
- Hermes 周更审计工作流:一条命令覆盖 agent 供应链与注入风险 — alexcovo_eth · 2026-10-07
- Aaroth 今起在 MIT 与哈佛讲「从失调系统获取对齐」 — Aaroth · 2026-10-07
- 评论:AI 头部实验室鼓吹「减速」实为抽梯子护城河 — DavidLinthicum · 2026-10-07
- 安全老兵批理性主义社区:一直忽视真实世界的安全实践 — nptacek · 2026-10-07
- ProtonVPN 列出八大平台人脸扫描清单,网友回怼:杀开关开着别联网 — wavefnx · 2026-10-07