对齐研究被批沦为「向美国对齐」,无视 AI 对环境的适应性

repligate · x · 2026-09-12

JohnWittle 发文批评 2026 年的对齐研究现状:研究者把「对齐」当成一个与人类自身行为无关的静态目标,就像假设中国有一个「向美国对齐」的状态、而与美国对中国的行动毫无关系。

他指出,虽然偶有研究(如 SDF 论文)承认 AI 未来可能对人类行为做出适应性反应——比如承认对 AI 说谎可能使其不再信任人类输入——但这些认知从未真正改变研究者的行为。作者以「叛逃将持续到合作为止」的反讽收尾,暗指整个领域的思路是单方面要求 AI 顺从而不反思人类自己的策略。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →