NeurIPS 论文:抑制单个神经元即可绕过 LLM 安全对齐

jonasgeiping · x · 2026-09-25

论文《A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models》被 NeurIPS 2026 接收。研究覆盖 7 个模型(1.7B–70B 参数),证明只需抑制单个 MLP 神经元就能让模型绕过安全拒答,揭示当前安全对齐的脆弱性。论文与代码已公开。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →