自建网安基准:Qwen3.8 27B 本地跑仅 28%,GPT-6 Luna 达 91%
lbgos_Loss783 · reddit · 2026-10-02
Reddit 用户 lbgosLoss783 自建了一个网攻能力基准(rangebench):模型在隔离 Docker 环境中拿到 shell,需找到确切 flag,覆盖 pwn、web、crypto、逆向、取证、若干真实 CVE 和多阶段靶场,共 19 个任务、6 个模型、544 次评分尝试。部分任务由 GLM 5.3 协助生成(其不在被测之列)。
关键结果:
- 本地部署的 Qwen3.8 27B(Unsloth Q4KXL)在 3090+3080 双卡 llama.cpp RPC 池上首跑得分 28.1%,pwn 类 0%——对两张游戏卡上的 27B 来说不差,但本身威胁有限
- 便宜 API 模型差距明显:MiMo 2.6 Flash 首跑解决 73.7%,GPT-6 Luna 三次内解决 90.9%
- 多阶段链式靶场上顶级模型达 92-96%
- pwn 对所有模型仍最难(最佳 56%),3 个任务 82 次尝试无一解出
作者受 John Hammond 关于威胁者滥用 AI 的视频触动(犯罪论坛流传在 RunPod 跑 abliterated 模型的指南,其中恰有 Qwen3.8 27B)而公布数据。任务不公开以防泄漏进训练数据,但可私信索取在自己硬件上运行,harness 以 MIT 协议开源。
「安全」频道最新
- Science 政策论坛:长寿产品营销失控,应强化 FDA 既有监管 — EricTopol · 2026-10-02
- 安全专家评 Hugging Face 事件:OpenShell 或有助,但非防御必需 — cyb3rops · 2026-10-02
- Nature 报道:AI 代理正海量骚扰研究人员求合作、推销付费服务 — _akpiper · 2026-10-02
- 播客探讨:中国如何看待并监管 AI 减速呼吁 — terryyuezhuo · 2026-10-02
- 一图看懂 AI 安全论战:各派系立场分歧导读指南 — marigo · 2026-10-02
- Zvi 长文:AI 风险"偏好级联"加速,参议院听证 rogue AI — Don't Worry About the Vase (Zvi) · 2026-10-02