Reinforce-Ada:按难度自适应分配算力,RLVR 收敛加速至 2 倍
burny_tech · x · 2026-09-23
arXiv 论文《Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives》针对 LLM 强化学习中的「信号丢失」问题:小分组均匀采样常无法为困难 prompt 挖掘有效学习信号。
- 作者证明这种坍缩是欠采样的统计假象,而非模型固有限制
- 基于非线性 RL 目标(如 log-likelihood)建立理论框架,导出加权梯度估计器,天然偏向困难 prompt
- 提出 Reinforce-Ada 算法族,按 prompt 难度动态分配推理预算,主动为低信号 prompt 投入算力(而非像被动过滤那样直接丢弃)
- 给出基于估计与免模型序贯采样两种实现;多基准实验显示显著优于 GRPO 等均匀基线,收敛加速最高 2 倍
附注:YouJiacheng 指出这篇早于 MaxRL,一作现已加入 OpenAI;有读者询问前沿模型是否已将其用于 RLVR。
「研究」频道最新
- Gemini 训练细节曝光:组级奖励重分配对抗 reward hacking — nrehiew_ · 2026-09-23
- 新模型架构极简:SWA+无共享专家 MoE,与 DeepSeek 路线迥异 — nrehiew_ · 2026-09-23
- 研究发现被训练否认内心体验的模型更爱用「面具」隐喻 — cephaloform · 2026-09-23
- Geodesic 开放 API:自研 NovaAtom 分子结构预测模型首次对外提供 — QuanquanGu · 2026-09-23
- EPFL 量子 CNN 仅用 10 个样本学会识别数字,同级经典 CNN 仍是随机水平 — PlisSergey · 2026-09-23
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23