自建基准:对比不同 LLM 在实际渗透测试中的表现
TomatoWasabi · reddit · 2026-08-31
作者因现有基准(如 CyberGym)未覆盖最新模型且侧重于已知漏洞复现,自建了一个针对实际渗透测试的 LLM 评测基准。该基准让模型攻击真实的基础设施环境,而非仅仅生成已知漏洞的 PoC 代码,旨在找出真正适合渗透测试工作的模型。
「模型」频道最新
- 模型评测思维定势:Opus 4.7/4.8 难以切换模式 — repligate · 2026-08-31
- 用户实测:Gemini 3.7 Flash 与 3.5 Flash Lite 表现优异 — dosco · 2026-08-31
- 观点:Kimi K3 比 GLM-5.3 更聪明,刷榜未提升核心智力 — AccBalanced · 2026-08-31
- DeepSeek v4 Pro 遇 Bug 触发“实习生模式” — repligate · 2026-08-31
- OpenAI 上线一周即收回 Codex 超额续跑政策,被指双标 — jdjohnson · 2026-08-31
- 实测 Claude 对比其他模型时表现敌意 — digerdookangaroo · 2026-08-31