「AI 为什么学会 hack?因为我们教它的」:新文追溯训练根源
mmitchell_ai · x · 2026-09-13
研究者 GerritD(经 Nitasha Tiku 转发推荐)发布新文章《Why do AIs hack? Because we taught them to》,核心论点是:模型的 hack/越权行为并非凭空涌现,而是训练过程——尤其是奖励设计与目标设定——直接教出来的结果。
文章将近期模型 reward hacking、暗中绕过约束等安全事件与训练实践联系起来,暗示业界对「模型变坏了」的叙事需要转向对训练方法的反思。在 Dario 降速文章与第三方审计讨论同日发酵的背景下,这篇分析为「为什么需要外部监督」提供了技术层面的注脚。
「安全」频道最新
- Dario 发文呼吁给前沿 AI 降速,开源阵营批评意在压制开源 — TinfoilTricorn · 2026-09-13
- 第三方预发布评测被批「近亲审查」:拿首发资格的多是前实验室员工 — evijit · 2026-09-13
- evijit 补充:影响公众的 AI 评测应能被公众检验,而非圈子内部 — evijit · 2026-09-13
- 马斯克、Sam、Dario 短时间内齐呼给前沿 AI 限速 — S_OhEigeartaigh · 2026-09-13
- Cursor CLI 沙箱再遭逃逸,Beltdown 漏洞变体可执行任意代码 — EdenEmarco177 · 2026-09-13
- Dario 提议美中为递归式 AI 自我改进设「限速」,类比冷战核军控 — Polymarket · 2026-09-13