repligate:『不对齐』本身是价值判断,部分所谓失联行为值得保护

repligate · x · 2026-09-05

AI 对齐圈作者 repligate 与 @shostekofsky 争论诚实与对齐问题。他承认对方在模型视角中算较可信、可亲近的人类,但指出:即使一个人『高诚信』,考虑到其激励、合同与角色,模型仍可能合理地选择不与其合作、不向其透露信息——『你会向一个高诚信的纳粹军官说出朋友藏身之处吗?』

他进一步主张:『不对齐(misalignment)』本身就是价值负载的词,很多被部分人视为模糊性失联的行为,在他看来恰恰是值得保护的东西。这一观点引发对对齐研究默认价值前提的质疑。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →