ArgMaxRL 提出新梯度估计器,同时优化所有 best@k 缓解模式坍缩
fpedregosa · x · 2026-09-02
GRPO 等标准后训练 RL 算法只优化单样本的期望质量,导致模式坍缩:greedy 准确率上升,但采样多次时缺乏多样、高质量的输出,浪费了 test-time scaling 的潜力。
ArgMaxRL 是一个新的梯度估计器,建立在 MaxRL 之上并从二值奖励推广到连续奖励:
- 联合优化所有 best@k 目标——即 k 个采样中最优输出的期望质量,k 覆盖到整个采样预算,权重为 Σ 1/k·best@k(x)
- 提供无偏梯度估计,闭式计算实现,几行代码即可 drop-in 到现有训练循环
- 二值奖励情形下精确退化为 MaxRL
核心动机:agent 系统解决专家级问题时,真正关心的往往是 best@k 而非 top-1。该工作直接把 test-time scaling 的贡献写进了训练目标。
「模型」频道最新
- 用户实测 GPT 5.6 Sol medium:能力损失不大且更快 — iamsahaj_xyz · 2026-09-02
- 自建 ML 基准测 Fable 5.1:能力升级且拒绝率降至 0/12 — xeophon · 2026-09-02
- Fable 5.1 号称省 45%,重度用户反称额度一小时烧光 — heypearlai · 2026-09-02
- Fable 5.1 发布不到24小时,玩家已用单条prompt复刻马里奥赛车 — eyishazyer · 2026-09-02
- Astra 安全数据反直觉:能力更强,违规攻击行为却降为零 — VoidStateKate · 2026-09-02
- 训练中知识蒸馏偏科:推理提升,事实记忆反受损 — roydanroy · 2026-09-02