Abliteration:去拒答的轻量方法

prajdabre · x · 2026-07-14

作者推荐一篇关于 **abliteration** 的博客,认为这是一种很轻量、可以有效“去审查/去拒答”的技巧。 核心思路是: - 用 **steering vectors** 改变模型权重,去掉 refusal 行为。 - 已知问题是:这样做往往会削弱模型能力,但可以通过一些轻量训练补回来。 - 这类方法本身并不新,作者称它大约已经有 **2–3 年** 历史,而且成本很低。 作者提出了几个还值得研究的问题: 1. 这种方法是否会在所有模型规模上都带来性能退化? 2. 在 MoE 模型里,删除某些安全专家能否达到同样效果? 3. 能否找到一种不损伤性能的 abliteration 方法? 4. 这种方法能否被用来诱导模型产生新行为?

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →