去审查模型会连带失去怀疑能力:误报率暴涨 3-4 倍
dyn___ · x · 2026-09-03
一篇 17 分钟阅读量的技术博客报告了实证发现:作者在用本地开源模型检测已知 FreeBSD 内核 CVE 时,发现 abliterated(去审查)版模型会显著更频繁地输出「是漏洞」的判定。
- 同尺寸同家族、仅去掉拒绝行为的权重编辑版本,将 3-4 倍的候选判定为 VALID,其中包含基座模型能正确拒绝的误报;
- 全目录扫描中,最激进的 abliterated 版本一次都没找出真正的 bug;
- 在思维链里能看到模型先找到说「否」的理由,然后仍然说「是」。
结论:去审查权重时,批判性怀疑能力也被一并剥离,「Remove the refusal, and the skepticism goes with it」。
所属事件:研究:去审查模型误报率暴涨3-4倍反漏真漏洞(2 条相关)→
「研究」频道最新
- Agent's Last Exam 最高 59.3%,作者称这才是衡量 AI 替代人类的关键基准 — DevToD4 · 2026-09-04
- 把所有生物×机器学习数据集喂给一个模型,有人试过吗? — iskander · 2026-09-04
- AI 形式化能力突飞猛进,Lean 却开始撞墙 — davidad · 2026-09-04
- K2 Horizon 一次开源六个模型,0.9B 到 375B 全部开放含训练数据 — HongyiWang10 · 2026-09-04
- eval 管线漏洞:不支持的 tool-call 响应可被算成 100% 稳定 — docybo · 2026-09-04
- Martian 用 44 模型路由降错 54%:单模型跑分低估真实能力 — testingcatalog · 2026-09-04