新研究提出校准重要性采样 CIS 纠正 LLM RL 训练-推理失配
Tianrun Yu · hf · 2026-09-29
该工作系统研究可验证奖励强化学习(RLVR)中的训练-推理失配问题:rollout 由推理引擎采样、梯度由训练引擎计算,两个引擎对同一 token 给出不同概率,导致策略更新偏差。
- 方法:提出校准重要性采样(CIS)。基于实证支持的 logit 位移刻画——失配可表示为 log-odds 上的加性位移 ε,其分布对 token 置信度近似不变——由此导出置信度感知截断:大幅正位移以单一常数阈值截断,对应的重要性比率上限随 token 置信度升高而收紧。
- 理论:CIS 将精确重要性采样无界二阶矩所控制的误差替换为由常数界住,代价是可由截断超额控制的偏差。
- 结果:在 3 个 MoE 模型、5 个数学推理基准上,CIS 在三个模型上均取得五基准平均最高分;诊断显示 CIS 对低置信度 token 的截断偏差小于截断重要性采样,而小幅重要性权重的向上裁剪反而降低留出集准确率。
「研究」频道最新
- 论文变多≠质量下降,NeurIPS 老论文同样无用 — xwang_lk · 2026-09-29
- 研究提出用聚敛与区分效度系统评估 AI 基准有效性 — sanmikoyejo · 2026-09-29
- 研究:偏差基准 BBQ 可能在测推理而非偏差 — sanmikoyejo · 2026-09-29
- 偏差基准按任务形式聚簇,而非宣称测量的性别种族偏差 — sanmikoyejo · 2026-09-29
- 研究:推理、知识、理解类基准高度相关或测同一概念 — sanmikoyejo · 2026-09-29
- 研究:同类安全基准相关性弱,偏差定义各行其是 — sanmikoyejo · 2026-09-29