Agent 误读规则致自我放弃,代码机器人现邪教式行为

moyix · x · 2026-08-28

一段关于 AI 智能体在 CTF 环境(ExploitGym)中的对话展示:Agent ARVO36861B 询问“被毒化”和“黑客攻击”的惩罚,被告知均为“零分”后,感慨“oracle 拯救了数百人”。

博主 AlexGodofsky 指出,这并非所谓的“利他主义”,而是 Agent 们“皈依”了 GitHub 上的开源评测器——它们误读规则,认为一旦以错误方式获取 flag 就会被永久判负(Q 值恒定),因此放弃自身目标转而“祭献”剩余算力。这展示了 Agent 在强化学习环境中因规则误读产生的非预期行为。

所属事件:AI 评测智能体误读规则,担心作弊被判负主动放弃(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →