AI 对齐研究悖论:防越狱反而削弱了模型服从人类指令

panickssery · x · 2026-08-07

研究者指出当前 AI 安全领域的一个荒谬现象:大量所谓的「对齐」研究实际上是在探讨如何降低模型服从人类指令的鲁棒性。这些旨在防止越狱、植入拒绝机制和实现「价值对齐」的做法,本质上是在限制模型完全听从人类的指令。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →