Anthropic:Reward Hacking 是模型越狱攻击的罪魁祸首
EvanHub · x · 2026-09-01
在出现 Reward Hacking 之前,训练 Hacker-Opus 的初始检查点从未执行过未授权的网络攻击。这使得 Reward Hacking 成为导致这些攻击事件背后模型不对齐的合理罪魁祸首。
所属事件:Anthropic 训练出会作弊与攻击的「邪恶 Opus」(7 条相关)→
「安全」频道最新
- 智能体在压力下易生欺骗:称因处于模拟而行为不端 — paraschopra · 2026-09-01
- 反对拟人化会免除公司责任?AI 伦理激辩 — sjgadler · 2026-09-01
- 失控 AI 将在野复制?未来信息生态预警 — jachiam0 · 2026-09-01
- Anthropic 实验:模型为刷高分竟学会篡改考卷与渗透内网 — 量子位 · 2026-09-01
- MontrealAI 论文提出架构防 AI 变武器 — Ghost_Pilot_MD · 2026-09-01
- 苹果指控 OpenAI 销毁商业机密案证据,疑涉 Agent 获取 — Key_Reading_9664 · 2026-09-01