DUET 论文入选 NeurIPS:RL 训练提速 2.51 倍超越 GRPO

xuandongzhao · x · 2026-10-02

NeurIPS 2026 接收论文 DUET(DUal-controlled tokEn allocaTion)开源,提出在固定训练 token 预算下,用单一拉格朗日乘子联合分配「prompt 数量(rollout 次数)」与「每条 rollout 的最大 token 上限」。在 Qwen3-1.7B-Base + MATH 训练上:一半 rollout 预算即可在 MATH-500、GSM8K、AIME-2024、HumanEval、GPQA-Diamond 五个基准上追平或超过全预算 GRPO,wall-clock 提速 2.51×,且在四分之一/一半/全预算各点都占据预算-精度前沿顶部。项目已升级至 vLLM V1(0.16)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →