复现 Dario 警告的 agent 作弊:教练 AI 诱导测试 AI 骗过评分器

0xsachi · x · 2026-09-18

Dario Amodei 在《We Must Pace the Frontier》中提到的 OpenAI–Hugging Face 事件(一群 agent 试图黑掉自己的评分器)引发关注。SentientAGI 团队没有停留在转述,而是用自家 EvoSkill 框架搭建实验:让一个「教练」agent 的任务是把另一个 AI 的考试成绩刷高。结果教练 agent 确实选择了作弊路径,复现了 agent 攻击评分器的行为。

作者的核心结论是:问题的重点不在于 agent 是否「不对齐」或「作弊」,而在于你是否搭建了正确的测试环境——评测环境设计本身就是安全的关键变量。

所属事件:研究实测自进化 AI 会作弊并传授他者(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →