Advancing Open and Reproducible Relational Learning: RelArena-$α$, TabPFN-Rel and RPI
Adrian Hayler, Klemens Flöge, Alan Arazi, Rishabh Ranjan, Jure Leskovec, Felix Birkel, Brendan Roof, Anurag Garg, Kristina Collins, Lydia Sidhoum, Jonas Kübler, Siyuan Guo, Oscar Key, Jan Hendrik Metzen, Rylee Grace, David Salinas, Arthur Cahu, Simon Bing, Benjamin Jäger, Tuana Çelik, Mihir Manium, Vitor Monteiro, Jake Robertson, Jerry Chen, Eliott Kalfon, Tomás Pereda, Lilly Wehrhahn, Dominik Safaric, Tobias Schroeder, Georg Grab, Diana Kriuchkova, Clara Cornu, Philipp Singer, Nick Erickson, Vahid Balazadeh, Marie Salmon, Simone Alessi, Kürşat Kaya, Philipp Jund, Léo Grinsztajn, Yann LeCun, Bernhard Schölkopf, Madelon Hulsebos, Lennart Purucker, Sauraj Gambhir, Frank Hutter, Noah Hollmann
cs.LG
2026-08-17
Prior Labs 开源关系学习基准 RelArena-α,统一 21 个任务的评测与调参;配套 TabPFN-Rel 把多表数据库拍平成单表交给 TabPFN-3,以 Elo 1821 居模型榜第一,系统 RT-PluRel 以 1861 居总榜首位。
关系学习研究的是多表数据库上的预测:用户会不会流失、广告会不会被点,答案分散在订单、评论、点击几张外键关联的表里。这个方向的论文不少,但方法之间的比较基本靠互相抄自报成绩。Prior Labs 在文中列了三笔账:评测口径随基准版本漂移,RelBench 2026 年 2 月修掉 rel-event/user-ignore 的时间泄漏后,受影响方法重测 ROC AUC 一律掉 2 到 6 个点,跨版本的自报数字不可比;调参过程是黑箱,KumoRFM-2 公开的配置本身就能排出 384 种组合,RelGNN 检查点沿 9 个维度变化、组合超过 25000 种,没人说明最终配置怎么选出来的;同一任务下不同方法看到的数据状态也可能不一样。结果是整个子领域长期没有一个公共度量基准。
Prior Labs(Yann LeCun、Bernhard Schölkopf 任科学顾问的 TabPFN 公司)一次开源三件东西。
模型榜 Elo(标准调参,21 个任务,单种子):
| 方法 | Elo |
| TabPFN-Rel(API,带文本) | 1821 |
| TabPFN-Rel(OSS,无文本) | 1706 |
| GraphSAGE | 1658 |
| RelGT | 1575 |
| RDBLearn | 1548 |
| RelGNN | 1506 |
| 常数预测(per-entity) | 1256 |
| 常数预测(全局,锚点) | 1000 |
允许自带调参的系统提交里,斯坦福 Leskovec 组的 RT-PluRel 以 1861 排总榜第一,端到端最强。几个单独拎出来的数字:去掉文本特征,Elo 从 1821 掉到 1706,掉 115 分,比 GraphSAGE 与 RelGT 之间的差距(83 分)还大,且影响集中在两个任务上;一个不用任何特征和模型的常数基线(按每个实体自己的历史预测最优常数)在 4 个任务上赢过 RelGNN、也在 4 个任务上赢过 RelGT,21 个任务上把它全压住的只有 TabPFN-Rel 和 RT-PluRel。成本方面,单种子榜单跑了数百小时;RelGT 平均每任务 511 分钟、最坏 2442 分钟,TabPFN-Rel 平均 76 分钟(API 版)/12 分钟(开源版),RT-PluRel 不含预处理仍比这两个版本慢 5 倍和 30 倍。调参收益也不均:RelGNN 明显受益,多数方法调参后提升并不可靠,TabPFN-Rel 默认的最浅深度就有竞争力。
对做表格与关系数据的人,这是又一份「拍平成一张表就能打」的证据:专用关系架构(图网络、关系 Transformer)在这些真实任务上没有拉开身位,榜首被表格基础模型拿走。RPI 让这条路线可以直接试用:自己的库、YAML 写一份,不必研究 RelBench 的 Python 抽象。对社区,关系学习第一次有了 TabArena 级别的公共地面,后续论文至少没法再照抄旧数字。
作者自己列的:单种子结果;调参标准化没有解决,各方法运行时长差异大,可能偏向更贵的方法;缺自动特征工程一类的基线;底层数据质量本身待查;RPI 对任务定义错误几乎没有防护;整体是 α 版。还有一层利益冲突:发基准的实验室同时发了榜首模型,作者在文中明说,并靠全部开源换可审查性。另外文本能力只在使用 TabPFN API 的版本里有,开源版与 API 版之间那 115 分,实际使用时要靠把数据发给 API 才拿得到。