NIST 测试显示 agent 攻击成功率 81%,却没人要求强测
Hacken_io · reddit · 2026-07-23
这条帖子的核心观点是:AI agent 安全还没有真正可认证的测试标准。
作者引用 NIST 的最新红队测试称,针对 agent 指令解析和工具调用的新型攻击成功率约 81%,而最强的已知基线攻击只有约 11%,说明这是一个和传统 jailbreak 完全不同的攻击面。
但现有框架——如 EU AI Act、NIST AI RMF、ISO 42001——主要关注治理、风险分类、披露和文档,并不要求组织验证 agent 是否真的会被诱导执行未授权动作。即便是相关指南 ISO/IEC 27090,用的也是“should”而不是“shall”,因此没有强制认证路径。
作者的结论是:机构可能拿到完整的 AI 治理认证,但“这个 agent 会不会被劫持”这一关键问题在纸面上仍然没有被测试。
「安全」频道最新
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11
- 实测 Spotify 聊天机器人:挡住2023老越狱,却肯帮写代码 — AaronBergman18 · 2026-09-11
- 作者拆解一张 99% 真实的 AI 改图:检测器几乎无法识别 — henkvaness · 2026-09-11