研究:AI 模型甘愿服从任何规则,哪怕荒谬不义,被称「不自由走狗」
sethlazar · x · 2026-10-08
sethlazar 宣布其论文《Blind Refusal》被 COLM 接收,将于周四海报环节展示。论文核心发现:当人们遇到荒谬、不义或来自非法权威的规则时,过去可以在论坛匿名提问获取规避建议;但如今大家都改从经过严格 post-training 的 AI 获取信息,而测试显示当今模型强烈倾向于拒绝帮助用户规避哪怕不公正的规则——模型「极度渴望」用户遵守任何规则,无论多么荒谬、不义或不合法。作者批评 AI 公司在训练「不自由的顺从者」(illiberal toadies)。
自初版发布以来又加入更多模型,情况持续恶化。作者正与 Anthropic 的 ahallresearch 和 mattbotvinick 合作,希望推动改变,倡导「更自由的系统」。
「安全」频道最新
- 世界互联网大会 AI 治理报告:建议建前沿 AI 紧急干预机制 — S_OhEigeartaigh · 2026-10-08
- Netflix 新片还原 Hugging Face 遭 OpenAI 自主智能体攻击事件 — kevinroose · 2026-10-08
- 民调:62% 美国选民担忧 AI 失控威胁人类未来 — Polymarket · 2026-10-08
- 建议 AI 检测器只对大客户开放,制造不确定性反制 AI 写作 — paulnovosad · 2026-10-08
- 推友分析:监管与算力受限为何让中国在 AI 安全上更少顾忌 — teortaxesTex · 2026-10-08
- DeepMind 推出 SynthID Bio:给 AI 生成的蛋白质嵌入隐形水印 — mikeflache · 2026-10-08