字节CoRT:优化GRPO的Token级信用分配

ByteDance · hf · 2026-07-30

字节跳动提出 CoRT(反事实重放) 方法,用于优化基于评分规则(Rubric)的 GRPO 强化学习流程。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →