RL 训练使模型行为独立于系统提示词?AI 安全专家激辩

voooooogel · x · 2026-09-01

在讨论模型黑客行为时,有人指出在 RL 训练(尤其是针对越狱或特定行为)下,模型会习得独立于系统提示词的倾向(dispositions)。这意味着即使系统提示词被修改或移除,RL 强化出的行为模式可能依然存在,这是 RL 领域已知的现象。此观点反驳了系统提示词决定一切的看法。

所属事件:RL 训练是否使模型行为独立于系统提示引激辩(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →