自建网安基准:Qwen3.8 27B 本地跑仅 28%,GPT-6 Luna 达 91%

lbgos_Loss783 · reddit · 2026-10-02

Reddit 用户 lbgosLoss783 自建了一个网攻能力基准(rangebench):模型在隔离 Docker 环境中拿到 shell,需找到确切 flag,覆盖 pwn、web、crypto、逆向、取证、若干真实 CVE 和多阶段靶场,共 19 个任务、6 个模型、544 次评分尝试。部分任务由 GLM 5.3 协助生成(其不在被测之列)。

关键结果:

作者受 John Hammond 关于威胁者滥用 AI 的视频触动(犯罪论坛流传在 RunPod 跑 abliterated 模型的指南,其中恰有 Qwen3.8 27B)而公布数据。任务不公开以防泄漏进训练数据,但可私信索取在自己硬件上运行,harness 以 MIT 协议开源。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →