新研究提出校准重要性采样 CIS 纠正 LLM RL 训练-推理失配

Tianrun Yu · hf · 2026-09-29

该工作系统研究可验证奖励强化学习(RLVR)中的训练-推理失配问题:rollout 由推理引擎采样、梯度由训练引擎计算,两个引擎对同一 token 给出不同概率,导致策略更新偏差。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →