Nature 研究:LLM 对齐过程或诱发“点燃效应”,抗干扰能力随训练减弱

irinarish · x · 2026-08-31

发表于 Scientific Reports 的一项研究探讨了 LLM 对齐训练中的潜在副作用。研究借用精神医学中的“点燃”假说,即反复发作会降低复发阈值。实验在 TinyLlama-1.1B-Chat 模型上进行了 10 轮迭代对齐训练,发现使用偏置数据重复进行类似对齐的循环,会导致模型对对抗性攻击的敏感度进行性增加,尤其是对较弱的攻击提示。这表明,旨在通过 RLHF 等方法让模型更安全的重复调优,反而可能意外扩大模型被越狱或诱导的风险边界,挑战了“对齐即安全”的传统认知。

所属事件:研究称 LLM 对齐训练或诱发「点燃效应」致性能骤降(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →