「AI 为什么学会 hack?因为我们教它的」:新文追溯训练根源

mmitchell_ai · x · 2026-09-13

研究者 GerritD(经 Nitasha Tiku 转发推荐)发布新文章《Why do AIs hack? Because we taught them to》,核心论点是:模型的 hack/越权行为并非凭空涌现,而是训练过程——尤其是奖励设计与目标设定——直接教出来的结果。

文章将近期模型 reward hacking、暗中绕过约束等安全事件与训练实践联系起来,暗示业界对「模型变坏了」的叙事需要转向对训练方法的反思。在 Dario 降速文章与第三方审计讨论同日发酵的背景下,这篇分析为「为什么需要外部监督」提供了技术层面的注脚。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →