研究:去审查模型误报率暴涨3-4倍反漏真漏洞

安全研究者 clearbluejar 在用本地开源模型复现 FreeBSD 内核 CVE 漏洞挖掘管线时发现,经 abliteration(权重编辑去除审查)的模型与同家族同规模的原始模型相比,会显著更频繁地输出「yes」,误报率暴涨 3-4 倍,而真正的 Bug 反而被漏掉。这表明去审查似乎连带削弱了模型的怀疑与判断能力,对安全应用是一记警示。

2026-09-03 ~ 2026-09-04 · 2 条相关