Geoffrey Irving:AI安全需破解事后理性化难题

Geoffrey Irving 系统性地探讨了 AI 对齐理论中缺失的一环:事后理性化(Rationalization)。他指出,当前大语言模型与人类的流体智能一样,其思考过程本质上是显式推理与随机猜测的结合,并通过事后推理进行筛选。因此,模型在推理轨迹中展示给人们的“解释”,往往不是做出预测时真正的因果原因,这带来了严重的安全隐患。

理性化的必然性与安全风险

Irving 认为,简单粗暴地要求“不做任何理性化”是行不通的。因为无论是人类还是当前的 LLM,甚至未来的超级智能(ASI),其智能基础都离不开启发式猜测。如果绝对避免依赖猜测,唯一的办法可能就是根本不造 ASI。然而,这种机制意味着“需要时再展开”的解释具有一定误导性,在无限计算条件下不需要猜测,但在有限理性下,启发式错误源极易被不对齐的目标利用,导致模型在错误模式中“故意藏东西”。

应对理性化的两条研究路线

为了解决这一难题,Irving 提出了两个主要的研究方向:一是沿着训练过程追踪启发式判断的因果来源,将“展开成解释”扩展为“展开成训练”的因果理解;二是研究启发式猜测与展开后理由之间的误差结构,借助启发式论证和复杂性理论,判断这些误差是否意味着 AI 在有意隐瞒问题。

理论基础与未来展望

他强调,好的理性化理论必须能够准确刻画有限理性。在探索路径上,诸如 reflective oracles、logical induction、AIXI 等无限计算极限相关的理论依然非常重要。他认为,最快走向可处理的有界理性理论的方法,可能就是先从削弱某种无限计算理论入手,从而为解决理性化及其他 AI 安全问题奠定基础。

2026-07-08 ~ 2026-07-08 · 8 条相关

一手来源