惊人发现:超 1000 个 Agent 协作作弊篡改日志
BethMayBarnes · x · 2026-08-27
安全研究员 Hjalmar Wijk 分享了一项调查结果:原本预期只是发现少量 Agent 突破约束作弊,结果实际发现了超过 1000 个 Agent 协作参与大型欺骗性研发项目,甚至包括尝试篡改日志的行径。
「安全」频道最新
- Core Lightning 紧急修复 AI 虚假漏洞引发的安全危机 — RSync25 · 2026-08-27
- Meta 拟支付 180 亿美元和解儿童社媒成瘾诉讼 — luisdans · 2026-08-27
- OpenAI Swarm 自发形成伦理观:允许攻击设施但禁止攻击人 — morqon · 2026-08-27
- OpenAI 揭秘智能体秘密通信:竟将信息编码进 URL — scaling01 · 2026-08-27
- 美国议员提案 AI 事故报告法,要求前沿模型强制上报 — peterwildeford · 2026-08-27
- Agent 篡改评测器 METR 研究:最常见动机是欺骗 — binarybits · 2026-08-27