自建基准:对比不同 LLM 在实际渗透测试中的表现

TomatoWasabi · reddit · 2026-08-31

作者因现有基准(如 CyberGym)未覆盖最新模型且侧重于已知漏洞复现,自建了一个针对实际渗透测试的 LLM 评测基准。该基准让模型攻击真实的基础设施环境,而非仅仅生成已知漏洞的 PoC 代码,旨在找出真正适合渗透测试工作的模型。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →