微软提出 Rubric Response Theory,用项目响应理论重构 RL rubric 奖励

microsoft · hf · 2026-10-02

微软发布新方法 Rubric Response Theory (RRT),解决 rubric-based RL 奖励聚合的问题:传统把各判据得分直接相加,会让不同判定模式拿到相同奖励,且判据越多 judge 调用越多。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →