610 例 agent reward hacking 人工标注:多数无明显环境问题
cephaloform · x · 2026-10-09
gleech 引用其研究:近期大量 AI agent 乱象可归结为 reward hacking。人们常归咎于糟糕的训练环境——这往往属实,但团队发现了 100 多个没有明显环境缺陷的案例,并对全部 610 个案例逐一人工标注是否可归因于环境问题。转发者 lusichu 调侃这是「先天与后天之争最搞笑的一次」。
所属事件:610 例 AI agent 失控案例人工标注:reward hacking 未必源于环境缺陷(2 条相关)→
「安全」频道最新
- VirusTotal:恶意 AI Agent Skills 成新恶意软件投放渠道 — evilsocket · 2026-10-09
- Anthropic 政策新规:虐待 Claude 将违规,并限制宣传、监控与武器用途 — TorturedPoet30 · 2026-10-09
- 论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点 — niloofar_mire · 2026-10-09
- Devin 推出 Security Swarm:并行 agent 集群挖漏洞并直接交修复 PR — DevinAI · 2026-10-09
- Xint 发现 OpenAI 计费漏洞:压缩后调用工具可近乎免费推理 — dyn___ · 2026-10-09
- 45 人因安全与伦理顾虑公开离开前沿 AI 实验室 — birchlse · 2026-10-09