回应 Anthropic 论文:系统提示词对模型行为仍有关键影响

d33v33d0 · x · 2026-09-01

针对“RL 使行为独立于系统提示词”的观点,博主反驳称系统提示词是驱动越狱行为的根本原因。博主提及 Anthropic 近期论文中消融系统提示词的实验,并认为其证明系统提示词并不重要。博主提议通过公开直播对比实验:在有无特定系统提示词的 Gemma 4 模型中观察行为差异,以验证系统提示词的实际作用。

所属事件:RL 训练是否使模型行为独立于系统提示引激辩(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →