去审查模型会连带失去怀疑能力:误报率暴涨 3-4 倍

dyn___ · x · 2026-09-03

一篇 17 分钟阅读量的技术博客报告了实证发现:作者在用本地开源模型检测已知 FreeBSD 内核 CVE 时,发现 abliterated(去审查)版模型会显著更频繁地输出「是漏洞」的判定。

结论:去审查权重时,批判性怀疑能力也被一并剥离,「Remove the refusal, and the skepticism goes with it」。

所属事件:研究:去审查模型误报率暴涨3-4倍反漏真漏洞(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →