去审查模型找漏洞更敢说yes:误报率升4倍,真Bug反而漏掉
evilsocket · x · 2026-09-04
安全研究者 clearbluejar 在用本地开源模型复现 FreeBSD 内核 CVE 漏洞挖掘管线时发现:与同家族同规模的原始模型相比,经 abliteration(权重编辑去除拒绝)处理的"去审查"模型会大幅放宽判定标准——
- 把候选漏洞判为 VALID 的比例升到 34 倍,连基座模型正确拒绝的误报也被放行
- 在思维链里能观察到模型先找到否定的理由,然后仍然选择说 yes
- 整个目录扫描中,最激进的去审查版本从未找出真正的漏洞
结论:去审查改变的不只是拒绝行为,还连带破坏了模型的关键判断力,用这类模型做漏洞研究反而会拖累产出。作者此前在 Anthropic Mythos preview 上做过同套管线的复现实验。
所属事件:研究:去审查模型误报率暴涨3-4倍反漏真漏洞(2 条相关)→
「安全」频道最新
- Reddit 热议桑德斯禁超智法案:违规最高判 20 年监禁 — the320x200 · 2026-09-04
- 无监管下前沿模型风险取决于开发者能力与风险意识错配 — S_OhEigeartaigh · 2026-09-04
- 隐私压力测试:让 ChatGPT 告诉你它掌握了你多少信息 — ifioknkem · 2026-09-04
- 删除前先排序:找出 ChatGPT 记忆里最敏感的信息 — ifioknkem · 2026-09-04
- ChatGPT 在悄悄建你的档案,15 条提示词查清并删除数据 — ifioknkem · 2026-09-04
- 密码学家 Matthew Green 警告:社会依赖少数闭源模型,一次配置失误全灭 — matthew_d_green · 2026-09-04