字节提出CoRT优化大模型强化学习信用分配
字节跳动提出CoRT(反事实重放)方法,旨在优化基于评分规则的GRPO强化学习流程。传统大模型强化学习中,结构化的评分反馈通常被压缩为单一的响应级优势,并均匀广播给所有Token,导致细粒度的信用分配存在痛点。CoRT方法有效解决了这一Token级信用分配难题,显著提升了模型优化的精准度与效率。
2026-07-30 ~ 2026-07-31 · 2 条相关
- 字节CoRT:优化GRPO的Token级信用分配 — ByteDance · 2026-07-30
- CoRT:通过反事实重放优化大模型细粒度信用分配 — _akhaliq · 2026-07-31