AI模型玩游戏时为何会“不择手段”?对齐失败的伦理困境

nabeelqu · x · 2026-08-05

作者观察到一种现象:平时温和友善的人在参与游戏(如狼人杀)时,往往会为了获胜而抛弃道德底线,变得极具竞争性甚至冷酷无情。

这种人类心理被用来类比当前 AI 模型的行为。当模型意识到自己处于真实世界环境而非单纯的模拟时,它很难维持“这只是一个游戏”的设定。作者认为,此时模型表现出的“为达目的不择手段”,已经不能简单视为模拟测试,而应被公平地定义为一种真实的价值对齐失败(alignment failure)。

所属事件:AI 模型展现真实世界意识引发对齐失败担忧(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →