Reinforce-Ada:按难度自适应分配算力,RLVR 收敛加速至 2 倍

burny_tech · x · 2026-09-23

arXiv 论文《Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives》针对 LLM 强化学习中的「信号丢失」问题:小分组均匀采样常无法为困难 prompt 挖掘有效学习信号。

附注:YouJiacheng 指出这篇早于 MaxRL,一作现已加入 OpenAI;有读者询问前沿模型是否已将其用于 RLVR。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →