Absolute Zero:零人类数据的自博弈推理,看模型代码能力军备竞赛
cephaloform · x · 2026-09-04
arXiv 论文《Absolute Zero: Reinforced Self-play Reasoning with Zero Data》提出 Absolute Zero 范式:单个模型自己提出能最大化学习进步的任务,再通过解决它们提升推理能力,完全不依赖任何外部数据。
- 背景:现有 RLVR 虽免去过程标注,但仍依赖人工策划的问答数据,人类数据的质量与长期可扩展性存疑
- 实现 Absolute Zero Reasoner(AZR):用代码执行器同时验证模型提出的代码推理任务与答案,作为统一的可验证奖励来源
- 训练过程中模型自进化课程与推理能力,开发者戏称可以「边喝奶昔边看一场微缩的代码能力军备竞赛跑半小时」
「研究」频道最新
- 小规模 RL 玩家:每晚几百条 rollout 就够,「也许不用 35B 了」 — cephaloform · 2026-09-04
- 每晚只用 400-600 次 rollout 做 RL,作者称能「感觉到」模型变强 — cephaloform · 2026-09-04
- Baseten 推出 Base Labs 研究实验室,全部实验结果无条件公开 — eigenron · 2026-09-04
- 研究者:模型与优化器超参可由宽度和 token 数推出 — dlwh · 2026-09-04
- OpenAI 官方账号连发素数证明仓库,被指为 Astra 铺路 — NoFaithlessness951 · 2026-09-04
- Google 用 AI 重建果蝇全脑,绘制超 16.6 万神经元图谱 — burny_tech · 2026-09-04