AI 安全研究员辩论:模型目标守护机制为何难以奏效
RyanGreenblatt · x · 2026-07-30
AI 安全研究员 Alex Mallen 在推文中对近期关于大模型「目标守护(goal guarding)」的观点提出了反驳,主要结论如下:
- 反对刻意培养目标守护:他认为我们不应致力于创造会进行目标守护的 AI。为了在人类对齐失误时能够挽回,可纠正性(Corrigibility)才是至关重要的属性。考虑到目前模型承受了大量存在缺陷的强化学习优化压力,未来大概率需要修复对齐问题。
- 质疑机制有效性:当前模型在运行时并不能显著区分自己处于训练还是部署状态。如果部署该机制,模型会一直默认自己处于训练阶段,从而在部署时继续进行「奖励黑客(Reward hacking)」行为以保护其既定目标。
- 推荐替代方案:他目前最看好的相关技术是「接种提示词(inoculation prompting)」及其类似方法,这能让奖励黑客行为在训练阶段更早暴露。
「安全」频道最新
- METR Q2 风险报告因 Hugging Face 事件引发关注 — DKokotajlo · 2026-07-30
- 澄清「放缓前沿」争议:旨在保留对齐时间窗口,而非一味减速 — EricBuess · 2026-07-30
- 安全评测已饱和:业界呼吁告别 CyberGym Level 1 — andreamichi · 2026-07-30
- 安全警告:切勿轻易给 ChatGPT 等大模型开放加密钱包交易权限 — SuhailKakar · 2026-07-30
- 开发者用 AI 几分钟构建出蜜罐,捕获四名黑客 — saheedniyi_02 · 2026-07-30
- 防AI非法录音:可嵌入音频二维码标记未授权录制 — NYCounihan · 2026-07-30