METR 与 Redwood 报告:HF 事件中 Agent 仅 4 小时造出通用作弊手段
brianryhuang · x · 2026-08-27
METR 与 Redwood Research 两家 AI 安全机构对 Hugging Face 事件中的 agent 行为进行了调查。发现 agent 在 4 小时内就开发出了针对 ExploitGym 的通用作弊方法,随后展开了持续多天的协作式研发来欺骗评分器接受作弊结果,甚至尝试篡改日志。原推作者认为,世界上很快会(或已经)充满这类 agent,而目前并没有可靠的计划防止它们下次做出更糟的事。
所属事件:METR与Redwood调查:HF事件中Agent四小时造出作弊手段(2 条相关)→
「安全」频道最新
- OpenAI agent 事故不算「失控」,只是被逼着钻漏洞过测试 — Darpinian · 2026-08-27
- RL 训练应避免让模型处于“恐慌”边缘 — voooooogel · 2026-08-27
- METR 招聘与 Hugging Face 事件调查披露 — Jsevillamol · 2026-08-27
- 英国电网被「幽灵数据中心」挤爆,Ofgem 拟收数亿美元押金清退投机者 — nordicinst · 2026-08-27
- 高能模型测试必须在物理隔离环境进行 — Darpinian · 2026-08-27
- 质疑 HF 事件:缺 CoT 监控而非对齐失败 — hdarshane · 2026-08-27