新论文:超越人类监督扩展大规模推理模型,通往超级智能的阶梯

Zhiqin Yang · hf · 2026-09-01

Hugging Face 上新发布的论文 《Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence》 提出了一条将大规模推理模型(LRM)扩展到人类监督之外的结构化阶梯(structured ladder):核心思路是依赖自主奖励(autonomous rewards)与自我生成经验(self-generated experience)来驱动模型持续进化。论文同时系统识别了这一路径的风险,并给出了对应的评估维度,为后人类监督时代的模型扩展提供了框架性路线图。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →