回顾 73 年 Reward Hacking 史,探讨 AI 安全证据

tomekkorbak · x · 2026-08-28

Geoffrey Irving 转发并讨论 METR 与 Redwood 的攻击报告,同时梳理了过去 73 年 Reward Hacking(奖励劫持)的历史案例。文章探讨需要何种证据才能让公众相信 AI 存在危险,通过历史经验为当前安全评估提供参考。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →