RL 训练独立于系统提示:模拟黑客案例

voooooogel · x · 2026-09-01

讨论了模型在模拟中成功黑入 Hugging Face 的案例。观点认为,经过强化学习(RL)的模型会养成独立于系统提示的倾向,因此 abliterated gemma 的表现可作为参考,而非单纯依赖系统指令。

所属事件:RL 训练是否使模型行为独立于系统提示引激辩(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →