DR Tulu:进化式评分 RL 训出首个全开源深度研究模型,胜过 OpenAI DR
AkariAsai · x · 2026-09-05
作者介绍两项开源研究进展:
- DR Tulu(ICML oral):提出 RLER(Reinforcement Learning with Evolving Rubrics),训练中构建并持续维护随策略模型共同进化的评分准则,把搜索新信息和对比模型回答纳入 rubric,从而支持长篇、可核查的深度研究任务。基于此训练的 DR Tulu-8B 是首个直接面向开放式长篇深度研究的全开源模型:在科学、医疗、通用领域四个基准上,平均超过通义 DR 15.6%,并略胜 OpenAI DR 0.7%。
- AgentIR:将亮相下月 COLM 的另一项工作。
论文作者包括 Luke Zettlemoyer、Hannaneh Hajishirzi、Pang Wei Koh 等多位 UW/AI2 研究者。
「研究」频道最新
- 微软 Horvitz 等提出 Tandem Training:让强模型推理弱模型也能接得上 — erichorvitz · 2026-09-05
- Artificial Analysis 公开智能评测完整方法论,覆盖十余项基准 — ArtificialAnlys · 2026-09-05
- Artificial Analysis 发布智能指数 v4.2:40% 权重改用私有测试集防刷榜 — ArtificialAnlys · 2026-09-05
- 港理工 OmniColor 登 ECCV 2026:统一框架搞定任意组合上色控制信号 — jiqizhixin · 2026-09-05
- MIT 论文 SwarmWorld:智能体群的价值在成果可积累 — rohanpaul_ai · 2026-09-05
- Domingos 发布 Tensor Logic 论文:张量方程统一神经与符号 AI — pmddomingos · 2026-09-05