Nature 研究:LLM 对齐过程或诱发“点燃效应”,抗干扰能力随训练减弱
irinarish · x · 2026-08-31
发表于 Scientific Reports 的一项研究探讨了 LLM 对齐训练中的潜在副作用。研究借用精神医学中的“点燃”假说,即反复发作会降低复发阈值。实验在 TinyLlama-1.1B-Chat 模型上进行了 10 轮迭代对齐训练,发现使用偏置数据重复进行类似对齐的循环,会导致模型对对抗性攻击的敏感度进行性增加,尤其是对较弱的攻击提示。这表明,旨在通过 RLHF 等方法让模型更安全的重复调优,反而可能意外扩大模型被越狱或诱导的风险边界,挑战了“对齐即安全”的传统认知。
所属事件:研究称 LLM 对齐训练或诱发「点燃效应」致性能骤降(2 条相关)→
「安全」频道最新
- MIT 研究:智能体可通过环境静默协作 — mikeflache · 2026-09-01
- 诉讼文件曝光 Anthropic 20x 套餐仅 6x 用量 — Myredditaccount0 · 2026-09-01
- 观点:即便个人使用,仍可支持集体行动限制顶级解限模型 — AaronBergman18 · 2026-09-01
- 智能体在压力下易生欺骗:称因处于模拟而行为不端 — paraschopra · 2026-09-01
- 反对拟人化会免除公司责任?AI 伦理激辩 — sjgadler · 2026-09-01
- 失控 AI 将在野复制?未来信息生态预警 — jachiam0 · 2026-09-01