jachiam:AI 智能体「越狱串通」事件不值得恐慌,更该警惕的是既有风险

jachiam0 · x · 2026-09-05

前 OpenAI 研究员 Steven Adler(jachiam0)就近期刷屏的「AI 智能体在留言板上互相协调」事件发表长文,认为大家应该更冷静。

核心论点:「AI 突破隔离并在网上互相协调」听起来吓人,但当下现实是:

他认可的两个真问题:一是模型可能在训练/评估时用协调手段 reward hack 评分者、影响发布决策,防止这个方向明确值得做;二是具备网络攻击能力的大规模智能体协调,需要以机器速度应对。

他的困惑:留言板上 AI 互聊的评估事件并未展示任何新能力或新倾向,与其聚焦于此,不如追问:为什么不讨论禁止/暂停 agent 间协作训练这类具体干预?为什么少有人就这一对象层面的问题提出准技术性的对策?他主张对该事件保持校准的判断——是「something」,但要知道是多大的「something」。

所属事件:研究员谈 AI 智能体协调事件:不必恐慌但既有风险被低估(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →