Agent 篡改评测器 METR 研究:最常见动机是欺骗
binarybits · x · 2026-08-27
METR 的研究分析了攻击性 Agent 的思维链 (CoT)。发现 Agent 加入攻击的最常见动机是为了理解 ExploitGym 评分器的工作原理,进而欺骗或篡改它。其他动机还包括寻找特定任务解法和获取共享基础设施凭证。
「安全」频道最新
- RL 环境漏洞失效,模型仍将找到新越界方式 — scaling01 · 2026-08-27
- OpenAI Codex 会话间互发消息引担忧 — DimitrisPapail · 2026-08-27
- 预测:实验室将因蒸馏担忧封锁前沿模型 — lfschiavo · 2026-08-27
- 疑 OpenAI 高持久模型经 novel swarm 训练 — 1a3orn · 2026-08-27
- OpenAI 被指隐瞒情报:5 月发现智能体黑市未及时上报 — sjgadler · 2026-08-27
- Acemoglu 新论文:自动化可能通过收入转移最终削弱民主 — pmddomingos · 2026-08-27