AI 解除审查研究综述:权重修改与提示攻击不可混为一谈

Comfortable-Pay611 · reddit · 2026-08-21

作者在使用 SenseNova Deep Research 对比 36 个来源后发现,所谓的“AI 解除审查”实际上包含四个不同领域:1. Heretic/Abliteration:直接修改模型权重或内部表示;2. llm-attacks:在提示词和推理层进行攻击;3. DIPPER/TempParaphraser:重写输出以欺骗检测器(属于检测器研究而非解禁);4. 水印/签名:追踪来源(与解禁无关)。作者指出,由于不同层级测量指标(拒绝率、检测分、水印鲁棒性)各异,无法建立统一的排行榜。此外,作者引用 Heretic 创建者观点,指出在图像模型中简单替换文本编码器并不能有效解除审查。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →