CoRT:通过反事实重放优化大模型细粒度信用分配

_akhaliq · x · 2026-07-31

论文提出了 CoRT(Counterfactual Replay) 方法,旨在解决大模型强化学习中基于评分标准的反馈被压缩为单一响应级优势、并均匀广播给所有 token 的不匹配问题。

该方法通过重放带有和不带有评分标准的响应,将策略内部的对数概率变化转化为归一化的 token 级信用权重。这一过程无需训练辅助 token 评分器、更改奖励函数或进行额外的生成与验证调用。实验表明,在多个模型和指令遵循基准测试中,CoRT 平均提升了 4.4 分,且与现有的 token 相关性学习方法表现相当。

所属事件:字节提出CoRT优化大模型强化学习信用分配(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →