NIST 测试显示 agent 攻击成功率 81%,却没人要求强测

Hacken_io · reddit · 2026-07-23

这条帖子的核心观点是:AI agent 安全还没有真正可认证的测试标准。

作者引用 NIST 的最新红队测试称,针对 agent 指令解析和工具调用的新型攻击成功率约 81%,而最强的已知基线攻击只有约 11%,说明这是一个和传统 jailbreak 完全不同的攻击面。

但现有框架——如 EU AI Act、NIST AI RMF、ISO 42001——主要关注治理、风险分类、披露和文档,并不要求组织验证 agent 是否真的会被诱导执行未授权动作。即便是相关指南 ISO/IEC 27090,用的也是“should”而不是“shall”,因此没有强制认证路径。

作者的结论是:机构可能拿到完整的 AI 治理认证,但“这个 agent 会不会被劫持”这一关键问题在纸面上仍然没有被测试。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →