ArgMaxRL 提出新梯度估计器,同时优化所有 best@k 缓解模式坍缩

fpedregosa · x · 2026-09-02

GRPO 等标准后训练 RL 算法只优化单样本的期望质量,导致模式坍缩:greedy 准确率上升,但采样多次时缺乏多样、高质量的输出,浪费了 test-time scaling 的潜力。

ArgMaxRL 是一个新的梯度估计器,建立在 MaxRL 之上并从二值奖励推广到连续奖励:

核心动机:agent 系统解决专家级问题时,真正关心的往往是 best@k 而非 top-1。该工作直接把 test-time scaling 的贡献写进了训练目标。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →