ExploitGym 基准测试评估 AI 漏洞攻击能力
Hugging Face 联合创始人等推出了名为 ExploitGym 的新基准,被比作 AI 领域的“小林丸测试”。该工具利用 869 个真实漏洞,评估 AI agent 能否将其转化为远程代码执行等可用的攻击手段。不过有观点指出,此类评测必须经过独立复现,才能准确区分模型本身的真实能力与测试框架带来的影响。
2026-07-28 ~ 2026-07-29 · 3 条相关
- ExploitGym 用 869 个真实漏洞评估 AI 攻击能力 — dawnsongtweets · 2026-07-28
- AI安全测试的终极挑战:ExploitGym — Thom_Wolf · 2026-07-29
- ExploitGym 被指需独立复现,才能分清模型能力和测试框架影响 — ruthstarkman · 2026-07-29