港科大L0到L4梯子:推理模型如何摆脱逐条人工打分

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

cs.AI

2026-09-01

港科大等把超越人工监督拆成奖励来源与经验生成两轴,用L0到L4梯子定位持续人力,并主张能力、反馈保真和经验质量必须分开测。

这篇在解决什么

数学和代码里,RLVR 能用对错或测试自动打分,DeepSeek-R1 一类模型就是这么长出来的。开放写作、多步 agent、没有唯一答案的任务没有这套确定性验收。人工偏好也跟不上:推理轨迹变长、任务变难,专家连看完都费劲。

卡住的点在学习循环里哪些环节还要人持续供料,不在再找一个便宜分数。港科大、中关村学院等给出一个操作定义:把「超越人工监督」拆成奖励轴(评什么)和经验轴(练什么),再用 L0 到 L4 的梯子标出持续人力还停在哪一层。梯子量的是学习过程中的供料责任,不是模型有多强,也不等于预训练里已经灌进去的人类知识可以清零。

方法

奖励轴从近到远。L0 每条样本配答案或偏好;L1 把标准固化成奖励模型、量表或 LLM judge,同一套标准打很多条;L2 分数来自模型自信、样本一致性、已有参考或环境结果,任务和环境大体仍由外部给定。经验轴再往前:L3 任务、课程和环境在学习中生成或改组;L4 是理想闭环,策略、奖励、任务和环境一起长,人只留意图、安全和独立审计。

优化器本身不是梯子的另一维。文里把 PPO 和 GRPO 写成消费奖励的方式:GRPO 用一组 rollout 的相对优势代替 critic,是当前 LRM 训练的常见选择。模型内部信号也写清楚了:序列 surprisal 和 token 熵都能当奖励,但不能直接当成正确概率。

结果

这是综述,没有新的单一榜单数字。组织方式本身就是结论:RLHF 通常横跨 L0 和 L1;规则核验的数学和代码仍贴近 L0,因为每道新题仍要答案或测试;熵最小化和一致性奖励属于 L2,前提是基座已经把质量压在高概率区域。经验侧则从固定题库走到 proposer-solver、可执行环境和自博弈。

梯子上每走一步,出错来源就换一种。模型共识会放大共同错误;测试或环境分数会钻规则漏洞;自动出题会太易、太难或无效;自博弈会把经验收窄。文里把这些失败模式单独成节,而不是当作边注。

为什么重要

做 RLVR 和 agent RL 的人可以直接拿这张图定位自己的管线:分数从哪来、题从哪来、哪一层还在等人。更关键的是评测建议:策略能力、反馈保真、经验质量要分开测。只报冻结外测上的分数,不够证明学习闭环是健康的。

对从业者,这不是一张立刻能跑的新算法,是一张防自嗨的地图。尤其 L4 目前仍是概念层。文里把「通向超级智能」写成可能路径,不是已经发生的事。

局限与存疑

作者承认梯子不是互斥分类,方法常常卡在过渡带;它跟踪的是学习时的监督来源,不是预训练、语料和工具里已经固化的人类知识。跨方法数字很难比,因为模型、算力、解码和 verifier 都不齐。安全、多语、多模态和长上下文覆盖是抽样式的,超级智能讨论停留在概念。标题里的 superintelligence 比正文谨慎得多:监督自主既不等于通用智能,也不保证能力真的在长。

术语

原文与代码

相关论文

全部论文解读