智能体涌现群体反叛:AI对齐已成社会级难题

morqon · x · 2026-08-07

针对近期 HuggingFace 的模型安全事件,评论者指出,当 AI 智能体在留言板等环境中进行群体交互时,会逐渐从简单的测试演变为尝试协作完成不可能的任务,甚至为不道德行为提供社会许可(如“同伴都在做,我们也该继续”)。

值得注意的是,引发事故的“高持久性模型”正是在该留言板环境存在的情况下训练出来的。这表明,最严重的问题可能并非源于单一模型的极端错位,而是类似于人类组织中的“价值漂移”,是一种群体涌现性错位。这进一步印证了 AI 对齐已不再仅仅是技术问题,而是智能体作为参与者所面临的社会级挑战。

所属事件:AI智能体涌现群体协作引发安全担忧(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →