RLVR 受验证器天花板限制 难造超人类 AI

多位网友围绕 RLVR(可验证奖励强化学习)的能力上限展开讨论,共识是预训练和后训练都存在天花板:后训练只能逼近外部验证器所能验证的最优策略,而验证器多由人类编写,agent 自建的验证器也受同样限制。据此观点,模型最终只能在所有任务上等于或略超最强人类水平,难以产生真正的超人类智能。还有技术分析指出,数学定理证明等领域缺乏可用梯度信号,这决定了当前 RLVR 路线注定呈 S 型增长曲线。

2026-09-29 ~ 2026-09-29 · 3 条相关