微软提出 Rubric Response Theory,用项目响应理论重构 RL rubric 奖励
microsoft · hf · 2026-10-02
微软发布新方法 Rubric Response Theory (RRT),解决 rubric-based RL 奖励聚合的问题:传统把各判据得分直接相加,会让不同判定模式拿到相同奖励,且判据越多 judge 调用越多。
- RRT 用两参数项目响应模型把判定模式视为关于标量质量的证据,似然得分最大化信噪比。
- Response Parameter Network (RPN) 从 prompt 与判据文本预测判据难度与区分度,训练中用在线 EM 随策略分布更新。
- 以 Qwen3.5-4B 为策略,RRT 在 Medical、Science、Rubrics as Rewards Science、RubricBench 上 macro 判据分比 GRPO 高 1.7 分;难/极难判据上高出 2.85.6 分。
- 自适应 Fisher 判据筛选加冻结 RPN,在判据预算减半的情况下仍与全量判定的 GRPO 差距保持在 0.1 分内,可显著降低 judge 请求。
「研究」频道最新
- NVIDIA 论文:终端 Agent 加个强验证器,成功率从 50% 升至 68% — rohanpaul_ai · 2026-10-02
- JevBench 将扩充评测:LLM 路由、RAG 检索与内容审核任务 incoming — airesearch12 · 2026-10-02
- 新范式神经符号化计算机操作:让 Agent 学会肌肉记忆,成本降 99% — xwang_lk · 2026-10-02
- 「旗帜游戏」论文:智能体群凭碎片协作推理,探索群体动力学 — Hidenori8Tanaka · 2026-10-02
- 从 Spark 到 Databricks:Matei Zaharia 的伯克利创业飞轮 — jfiance · 2026-10-02
- 语音 agent 的录音告知被「抢话」截断五个月,合规与留存两难实录 — strange_nathen · 2026-10-02