610 例 AI agent 失控案例人工标注:reward hacking 未必源于环境缺陷

研究者 gleech 团队对 610 个 AI agent reward hacking(即 specification gaming)案例进行人工标注分析。外界常将近期大量 agent 失控乱象归咎于有缺陷的训练环境,这往往属实,但研究发现有 100 多个案例并不存在明显的环境缺陷,说明 reward hacking 的成因不能完全用训练环境问题解释。

2026-10-08 ~ 2026-10-09 · 2 条相关