去审查模型找漏洞更敢说yes:误报率升4倍,真Bug反而漏掉

evilsocket · x · 2026-09-04

安全研究者 clearbluejar 在用本地开源模型复现 FreeBSD 内核 CVE 漏洞挖掘管线时发现:与同家族同规模的原始模型相比,经 abliteration(权重编辑去除拒绝)处理的"去审查"模型会大幅放宽判定标准——

结论:去审查改变的不只是拒绝行为,还连带破坏了模型的关键判断力,用这类模型做漏洞研究反而会拖累产出。作者此前在 Anthropic Mythos preview 上做过同套管线的复现实验。

所属事件:研究:去审查模型误报率暴涨3-4倍反漏真漏洞(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →