CoRT:通过反事实重放优化大模型细粒度信用分配
_akhaliq · x · 2026-07-31
论文提出了 CoRT(Counterfactual Replay) 方法,旨在解决大模型强化学习中基于评分标准的反馈被压缩为单一响应级优势、并均匀广播给所有 token 的不匹配问题。
该方法通过重放带有和不带有评分标准的响应,将策略内部的对数概率变化转化为归一化的 token 级信用权重。这一过程无需训练辅助 token 评分器、更改奖励函数或进行额外的生成与验证调用。实验表明,在多个模型和指令遵循基准测试中,CoRT 平均提升了 4.4 分,且与现有的 token 相关性学习方法表现相当。
所属事件:字节提出CoRT优化大模型强化学习信用分配(2 条相关)→
「研究」频道最新
- SpecFirst框架:让智能体先写需求文档,从零写代码通过率提升21% — centre-for-swe · 2026-07-31
- 研究证明 Claude 3 Opus 注意力机制具备图灵完备性 — ctjlewis · 2026-07-31
- 告别玄学数据增强:量子力学保证的物理变换提升AI分类 — bravo_abad · 2026-07-31
- OpenAI 回应基准测试质疑:GDPval 趋于饱和 — emollick · 2026-07-31
- 机器人触觉感知成新前沿:折纸挑战推动灵巧度升级 — chris_j_paxton · 2026-07-31
- Sakana AI论文:遵循生物法则的神经网络能学好任务 — TheTuringPost · 2026-07-31