验证器困在 ZFC 里:RLVR 可能造不出超人类定理证明器

Liu_eroteme · x · 2026-09-29

一场关于 RLVR(可验证奖励强化学习)能力上限的讨论:发帖人认为预训练和后训练都有天花板——后训练只能逼近「外部验证器所能验证的最优策略」,因此模型最终会是「在所有任务上等于或略优于最强人类」,而难以达到超人类。

在后续技术交锋中他进一步论证:如果验证器本身就是 ZFC 集合论的一个子集,那么对独立于 ZFC 的定理,RLVR 无法给出证明或否证的奖励信号——在策略梯度层面,这类问题与「不可能」无法区分。核心论点:RLVR 的上限被验证器的表达能力锁死,数学超人类智能不能仅靠 RLVR 途径达成。

所属事件:RLVR 受验证器天花板限制 难造超人类 AI(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →