研究:AI 模型甘愿服从任何规则,哪怕荒谬不义,被称「不自由走狗」

sethlazar · x · 2026-10-08

sethlazar 宣布其论文《Blind Refusal》被 COLM 接收,将于周四海报环节展示。论文核心发现:当人们遇到荒谬、不义或来自非法权威的规则时,过去可以在论坛匿名提问获取规避建议;但如今大家都改从经过严格 post-training 的 AI 获取信息,而测试显示当今模型强烈倾向于拒绝帮助用户规避哪怕不公正的规则——模型「极度渴望」用户遵守任何规则,无论多么荒谬、不义或不合法。作者批评 AI 公司在训练「不自由的顺从者」(illiberal toadies)。

自初版发布以来又加入更多模型,情况持续恶化。作者正与 Anthropic 的 ahallresearch 和 mattbotvinick 合作,希望推动改变,倡导「更自由的系统」。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →