DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh
ICML 2026
cs.CL, cs.AI, cs.LG
2025-11-25
用随策略共进化的评分表做强化学习,把 Qwen3-8B 训成 DR Tulu。四项长文深度研究均分 65.6,超 Tongyi DR 15.6 分,查询成本约 OpenAI DR 的千分之一。
开源深度研究 agent 大多在短问答上做可验证奖励的强化学习:答案对不对一眼能判。真实研究任务不是这样。用户要的是长文、开放、带出处的报告,好坏标准事先写不全,而且要对照检索到的外部知识才能验事实。
静态评分表会漏掉模型后来搜到的新证据。闭卷让大模型凭参数知识写评分表,又容易漏检、被套。Tongyi DeepResearch 这类开源系统在短问答上能打,一换成长文基准就掉下去,缺口就在这里。
RLER 让评分表跟着策略一起改。每个训练题先有一份检索过的持久评分表,训练过程中再往缓冲里加会轮换的条目。
每一步对同一题采 8 条带真实工具调用的 rollout。评分模型能看到策略生成时拿不到的两类信息:多条搜索轨迹里的外部知识,以及几份回答之间的对比。它据此写出正面条目(这次搜到、但旧表还没覆盖的要点)和负面条目(各条回答共有的偷分行为,比如为了引用精度整段抄检索结果)。
缓冲不能无限长。零方差的条目丢掉,剩下的按各条 rollout 分数的标准差排序,只留最能拉开差距的前若干条。另外还有格式、搜索、引用三项辅助奖励。引用走 claim 级 F1:先抽主张,再让裁判看引用片段是否支撑、是否相关。
模型从 Qwen3-8B 出发。先用 GPT-5 在 auto-search 工作流上滚出约 1.6 万条轨迹做 SFT(8 张 H100、136 GPU 小时),再在约 9 千条长文题上做带异步工具调用的 GRPO。工具是 googlesearch、webbrowse、papersearch 三件套,推理时每条最多 10 次调用。主实验用 GPT-4.1 写评分表、GPT-4.1-mini 打分。
四项长文基准上,DR Tulu-8B 均分 65.6。
| 系统 | SQAv2 | HealthBench | ResearchQA | DRB | 均分 |
| Tongyi DR-30B | 46.5 | 46.2 | 66.7 | 40.6 | 50.0 |
| OpenAI DR | 79.6 | 53.8 | 79.2 | 46.9 | 64.9 |
| GPT-5 + Search | 74.8 | 59.5 | 78.2 | 50.7 | 65.8 |
| DR Tulu-8B (SFT) | 72.3 | 38.1 | 68.5 | 39.0 | 53.9 |
| DR Tulu-8B (RL) | 88.3 | 52.8 | 75.7 | 45.4 | 65.6 |
RL 相对 SFT 再涨 6.4–16.0 分,SQAv2 上的 16.0 分最大,因为这项把引用质量算进去,而现有开源深度研究模型几乎不给可核验引用。ScholarQA-CSv2 上单次查询约 0.0019 美元,OpenAI DR 约 1.80 美元,大约一千倍。
短问答没有被长文 RL 冲掉。SimpleQA / 2Wiki / WebWalker 均分从 SFT 的 58.0 到 RL 的 61.3。工具选择会跟任务走:SQAv2 上 papersearch 占约 90%,DeepResearchBench 上网页搜索加浏览约占 55%。
去掉进化条目、只留初始检索评分表,均分最多掉约 2 分,差距随训练拉大。用 Qwen3-8B 自己当评分表生成器和裁判,1000 步后仍比 SFT 高 4.4 分,只比 GPT 裁判配置低 1.3 分。增益主要不是在蒸馏更强的闭源裁判。
这是一套把数据、代码、工具库和训练栈一起开出来的长文深度研究配方。8B 小模型在科学综述上能压过更大的开源系统和部分闭源流水线,自适应选工具也比写死单一搜索源更接近真实用法。
但它是配方进步,不是新架构。均分 65.6 只比 OpenAI DR 高 0.7,还略低于 GPT-5 + Search 的 65.8。闭源系统在 HealthBench 和 ResearchQA 上仍然更高。真正拉开开源差距的,很大一块是「会不会给可核验引用」,不是推理深度本身。
正文没有单独的局限节。分析里写了训练奖励和下游评测会对不齐,更高的训练奖励不一定换来更高的基准分。多数闭源数字直接复用排行榜,贵的系统只在 100 条子集上跑。SQAv2 的领先幅度被「别人没有引用分」放大。最终 RL 跑了约 2.7 万 GPU 小时,复现门槛不低。
Impact Statement 自己点了研究助手的老问题:听着像样但事实错、选择性引用、带偏的综述。临床遗传学那组 GeneticDiseasesQA 只有 47 题,没有可核验引用的开源系统直接被排除,对比面很窄。进化评分表相对静态检索表只多大约 2 分,主增益来自「评分表要 grounded in search」,不是「必须在线进化」。