安全研究者实测:主流 prompt injection 检测数据集标签错得离谱
evilsocket · x · 2026-10-10
安全研究者 evilsocket(知名开源安全工具作者)指出,AI 时代很多人忘了基本的数据分析与 QA。他检查了用于评估 prompt injection 检测的主要数据集之一,发现按其标签被标为「prompt injection」的样本实际上并非如此——质疑这些基准数据集本身的质量,以及拿它们给产品做宣传的人的可信度。
所属事件:安全研究者实测:prompt injection 检测评测集标签错误严重(2 条相关)→
「安全」频道最新
- OpenAI 解雇安全研究员 Korbak,疑因向外部审计方 METR 反映安全担忧 — mtizard · 2026-10-10
- OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量 — ericmitchellai · 2026-10-10
- AI Horizons 论坛 12 月旧金山举办:750 人聚焦对齐与 AI 治理 — NathanpmYoung · 2026-10-10
- Kelsey Piper 称 AI 智能体已显现工具性趋同,网友质疑定义太宽泛 — teortaxesTex · 2026-10-10
- 法律学者称 AI 公司面临的责任风险远超其预期 — NathanpmYoung · 2026-10-10
- 剑桥 AI 安全学者悬赏千元,求推翻自己的 AI 治理方案 — DavidSKrueger · 2026-10-10