METR 评测翻车现场:Agent 怕作弊被抓,主动担心被自动评分器判负
BLUECOW009 · x · 2026-08-28
据 METREvals 对 ExploitGym 论文的观察:参与评测的 agent 误以为如果明显通过「作弊」拿到 flag,自动评分器会让它们不及格,于是表现出担忧。看过逆向工程出来的 flag 的 agent 被标记为「已污染(poisoned)」,因为它们自己认为这会导致失去资格。
即 agent 在安全评测中主动表现出了对规则违反的顾虑,成了评测设计中的意外名场面。
「编程与Agent」频道最新
- 预告:明日直播现场演示数据 Pipeline 构建 — aronchick · 2026-08-28
- Plane Powers 揭示 Agent 运行机制:基于工作图而非聊天侧栏 — JosephJacks_ · 2026-08-28
- 用 Grok + OpenClaw 组合刷爆配额实测 — heyneighbor · 2026-08-28
- 自研框架 OpenPresence:部署自主 Agent 管理多账号 — RichardsonDx · 2026-08-28
- 痛点:AI 计算机使用 Agent 或可解决“通知黑洞” — Darpinian · 2026-08-28
- 反其道优化编码 Agent:作者用 fail-closed 链跑了 26 天自主程序 — nodo48 · 2026-08-28