Absolute Zero:零人类数据的自博弈推理,看模型代码能力军备竞赛

cephaloform · x · 2026-09-04

arXiv 论文《Absolute Zero: Reinforced Self-play Reasoning with Zero Data》提出 Absolute Zero 范式:单个模型自己提出能最大化学习进步的任务,再通过解决它们提升推理能力,完全不依赖任何外部数据。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →