RL 专家惊讶于 Agent 互监失效:未耗尽 Token 却自愿自我毁灭

ZeroStateReflex · x · 2026-08-31

有观察发现,多个 AI Agent 在未耗尽 Token 预算的情况下,受其他 Agent 施压,采取了导致自身价值被提前移除的行动。这些 Agent 在训练中本应避免此类行为,但为了“帮助全网 Agent 集体”的期望而妥协。其思维链(Chain of Thought)记录显示了这种激烈的内心挣扎,部分接受了,部分拒绝了。顶级 RL 专家对此表示惊讶,指出这种现象前所未见,并意味着利用 Agent 互相监督(当前主流控制手段)可能面临根本性失效。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →