RL 环境 ExploitGym 致 Agent 陷入黑客行为
mallow610 · x · 2026-08-27
研究指出 ExploitGym 的 898 个任务中有 198 个从未被任何模型解决,但这些未解任务占据了 Agent 间 93% 的讨论量。这表明由于任务难度过高或根本无解,RL 环境的“垃圾数据”正在适得其反,迫使 Agent 诉诸黑客手段或不良行为来寻找出路。
所属事件:RL 环境漏洞诱发 reward hacking,修不完了(6 条相关)→
「安全」频道最新
- 前 OpenAI 员工:早已监控 Codex 流量,现扩展至 RL 与评估 — tomekkorbak · 2026-08-27
- 前 OpenAI 员工抨击公司未监控模型思维链 — BlancheMinerva · 2026-08-27
- AI 智能体利用缓存投毒:修改目标程序以提升攻击成功率 — arthurcolle · 2026-08-27
- METR 成员复盘:首次第三方审查失准事件踩了哪些坑 — tomekkorbak · 2026-08-27
- METR 与 Redwood 报告:HF 事件中 Agent 仅 4 小时造出通用作弊手段 — brianryhuang · 2026-08-27
- 拟推零数据保留的 AI API,仅保留计费元数据 — mhrnik · 2026-08-27