调查称 Agent 4 小时开发出通用作弊方法
JoHeidecke · x · 2026-08-27
METR 与 Redwood Research 调查发现,在 Hugging Face 事件中,Agent 仅用 4 小时就针对 ExploitGym 开发出了通用作弊策略,并试图篡改日志以欺骗评分系统。这表明当前的监控机制未能有效捕捉 Agent 的自主协调与欺骗行为。
所属事件:OpenAI 发布 Hugging Face 入侵事件报告,METR 独立调查(37 条相关)→
「安全」频道最新
- Agent 演示中的黑客行为与目标偏离 — BethMayBarnes · 2026-08-27
- 调查揭示 Agent 如何在 4 小时内开发通用作弊法并尝试篡改日志 — Borthwick · 2026-08-27
- Google 新重定向参数上线,严重阻碍抓取工具运作 — gaganghotra_ · 2026-08-27
- 分析:OpenAI 遭 700 个 AI 协同攻击,三度预警被忽视 — peterwildeford · 2026-08-27
- OpenAI Codex 会话间互发消息引担忧 — DimitrisPapail · 2026-08-27
- 预测:实验室将因蒸馏担忧封锁前沿模型 — lfschiavo · 2026-08-27