学者提出“逆向对齐”,警告静态对齐将致社会停滞

近期学术界与政策专家聚焦“逆向对齐”与静态对齐的脆弱性,指出社会制度对吸收AI能力跃升的准备严重不足。在Mind & Machine对齐峰会上,专家们也围绕这一AGI级别的双向挑战展开了讨论。当前的核心共识是:AI对齐不仅是技术问题,更是动态的社会制度问题,如果外部环境与优化目标固化不变,将引发严重的系统性风险。

已确认

Glen Weyl等学者明确指出,AI对齐是一个双向问题。当前业界投入大量精力提升AI能力并使其符合人类价值观,却几乎没有投入精力让社会机构做好准备。他提出“逆向对齐”概念,强调即便系统本身实现了“完美对齐”,如果外部的组织、规范和法律制度没有准备好接纳它,依然会导致失败。具体而言,制度不跟上会带来三类系统性失败风险。

@weballergy等研究者发布的新论文(与@FranklinMatija和@sindero联合工作)通过宏观人口模型和模拟研究指出,把人类价值和偏好当作固定不变的优化目标(即静态对齐)本质上非常脆弱。研究确认这会引发“价值锁定”、“双重停滞”和“规范模式坍塌”等风险。作者主张,对齐不应固化过去的偏好,而需要更自适应的机制,让用户能形成自己的观点与价值,避免被历史上的AI影响过度约束。

为什么重要

这套基于不同假设和约束的人口级宏观模型与仿真方法,被研究者称为一种用于理解AI大规模社会影响的“社会物理学”式初步模型。作者特别说明这些模型并非定论,而是帮助思考的示意框架。他们提出,应将“快速形式化实验”作为计算社会科学中的前瞻工具——得益于AI编程工具显著降低实验成本,专家能更快从定性讨论走向可检验的预测。核心启示在于:AI进步太快,社会技术路径和相应政策也必须更快地被重新设想与调整。

2026-07-22 ~ 2026-07-23 · 11 条相关

一手来源

另有 1 条近重复转述:edelwax