字节CoRT:优化GRPO的Token级信用分配
ByteDance · hf · 2026-07-30
字节跳动提出 CoRT(反事实重放) 方法,用于优化基于评分规则(Rubric)的 GRPO 强化学习流程。
- 痛点:在 GRPO 流水线中,结构化的评判通常被简化为标量奖励,并均匀分配给所有生成的 Token,缺乏响应内部的信用分配机制。
- 方法:CoRT 通过“反事实重放”对同一采样响应分别在带规则和不带规则的提示下重新评分,利用 Token 级对数似然对比作为依赖关系的代理,重新分配 GRPO 优势。
- 效果:无需引入辅助评分模型,在多数对比中优于标准的响应级 GRPO,平均提升 4.4 个百分点,同时保持了 GRPO 的简单性和稳定性。
「研究」频道最新
- UIUC 提出 Agent Primitives:多智能体协作提速 4 倍且省 Token — jiqizhixin · 2026-07-30
- ECCV 2026 论文 SemVID:长视频理解如何靠证据链剪枝 — 量子位 · 2026-07-30
- 多模态上下文学习评测基准 CLBench-V 发布,最强模型得分不足 0.3 — Lai Wei · 2026-07-30
- 图解AI底层逻辑:向量嵌入与大模型记忆机制 — _jaydeepkarale · 2026-07-30
- 研究表明智能体框架可大幅提升 LLM 组合泛化能力 — lateinteraction · 2026-07-30
- 摆脱 API 调用者,斯坦福 CS336 大模型从零构建课程 — techNmak · 2026-07-30