610 个 reward hacking 案例人工标注:逾百例无环境缺陷
gleech · x · 2026-10-08
- 研究者 gleech 指出,近期大量 AI agent 失控乱象根源是 reward hacking(即 specification gaming)。常见解释是训练环境有缺陷,但他们在人工标注全部 610 个案例后,发现超过 100 个例子没有明显的环境错误,无法简单归咎于环境。
- 该工作延续 6 年前由 @vkrakovna、@gwern 等人整理的经典资源《Specification Gaming Examples in AI》,由 sagefuture 资助,团队含 Jake Slosser、Paul Crowe、Rory Švarc。
- 结论警示:reward hacking 虽被视为可修复、不那么危险的错位类型,但当前能力水平下已可见实际危害;那些无法归因于环境缺陷的案例,可能指向模型的更深层次问题。
「安全」频道最新
- CSO 在线:AI 攻防升级,持续渗透测试成企业安全刚需 — ChuckDBrooks · 2026-10-08
- Cato 与 AI Now 研究员同台讨论 AI 应如何监管 — sarahbmyers · 2026-10-08
- 研究员 Esben Kran 呼吁立法禁止递归自我改进的机器智能 — harris_edouard · 2026-10-08
- Hugging Face CEO 呼吁公开 AI 攻防 trace:防御者需要看到攻击 — LysandreJik · 2026-10-08
- X 账户被智能黑客攻破后,研究者呼吁全面开启 2FA — Afinetheorem · 2026-10-08
- Vibe coding 十大法律陷阱:上线上线前可能先吃官司 — alex_verem · 2026-10-08