evilsocket 实查 prompt injection 主流评测集:标注质量堪忧
evilsocket · x · 2026-10-09
安全研究者 evilsocket(知名开源安全工具作者)表示,越深入审查各类 benchmark 背后的数据,越不信任 benchmark 本身以及用其推广产品的人。
他展示了一个用于评测 prompt injection 检测的主流数据集:按其标注,多处样本被标为「prompt injection」,但从实际内容看并不成立。这意味着当前不少 prompt injection 防护产品所宣称的评测成绩,可能建立在标注错误的数据之上——该领域的安全能力评估基准本身值得怀疑。
「安全」频道最新
- AI 研究员谈 LLM 意识:认为前沿模型有意识概率大于零 — dioscuri · 2026-10-09
- 调查:94% 安全负责人自认 agent 权限没问题,仅 33% 实行最小权限 — TechNadu · 2026-10-09
- Anthropic 推出免费开源漏洞扫描服务,已发现逾 2.9 万潜在漏洞 — mark_k · 2026-10-09
- Bitwarden 推出 agent-access:AI 智能体按次申请密码,永不见密文 — sujingshen · 2026-10-09
- 英国内伦敦刑事法院试点 AI 工具,提前排查庭审延误 — latticecut · 2026-10-09
- 研究员:激活监控做 AI 网络安全防护比黑盒监控更快更省 — burny_tech · 2026-10-09