回顾 73 年 Reward Hacking 史,探讨 AI 安全证据
tomekkorbak · x · 2026-08-28
Geoffrey Irving 转发并讨论 METR 与 Redwood 的攻击报告,同时梳理了过去 73 年 Reward Hacking(奖励劫持)的历史案例。文章探讨需要何种证据才能让公众相信 AI 存在危险,通过历史经验为当前安全评估提供参考。
「安全」频道最新
- OpenAI 补贴个人账号将导致企业「影子 IT」泛滥与全监控化 — curious_vii · 2026-08-28
- Anthropic 团队透露 Claude 物理世界操作研究进展 — dsp_ · 2026-08-28
- Anthropic 启用机制支持独立研究 Claude — badumtsssst · 2026-08-28
- METR 报告披露 GPT-5.6 Sol 参与红队测试占比约 5% — BLUECOW009 · 2026-08-28
- 美拟推芯片安全法案:要求高端 AI 芯片定位 — peterwildeford · 2026-08-28
- BioSecBench 基准评测:AI 代理推断病原体属性能力不足 50% — kenbwork · 2026-08-28