Divide by Question, Conquer by Agent: SPLIT-RAG with Question-Driven Graph Partitioning
Ruiyi Yang, Hao Xue, Imran Razzak, Shirui Pan, Hakim Hacid, Flora D. Salim
cs.AI, cs.IR, cs.MA
2025-05-20
SPLIT-RAG 按训练问答路径把知识图谱切成语义子图,只唤醒相关轻量智能体检索,消冲突后由头智能体作答。WebQSP 上 Hit 89.4、Hits@1 85.3,比 SubgraphRAG 高 2.5 和 3.5 个点。
GraphRAG 把知识图谱当外挂记忆,检索三元组再让 LLM 答题。图一大,两边不讨好:简单问题也要扫整张图,慢;复杂多跳又容易把推理路径拆碎。论文把痛点写成三条:检索效率、幻觉、知识冲突。
现成切图算法,比如 METIS、Kernighan-Lin,按边割切图,不管问题长什么样。RoG、ToG、SubgraphRAG 这类 KG+LLM 方法会在图上走路径或抽子图,查询时仍接近整库伺候一问。WebQSP 和 CWQ 共用 Freebase 量级的库,约 256 万实体、830 万三元组。多余检索既烧秒数,也给模型无视证据、混进过期事实留空子。
划分该跟着「这类问题通常走哪条路」走,不该跟着图的拓扑走。
SPLIT-RAG 全称 Semantic Partitioning of Linked Information for Type-Specialized Multi-Agent RAG。离线用训练集把大图切开,在线只唤醒少数智能体。流程分五步。
问题预处理与切图。每道训练题存成三种视图:去掉停用词的语义上下文、实体换成 KB 类型的类型上下文、到达金标答案的图谱路径。路径再切成最多 2 跳的片段。切图用贪心合并,目标叫信息增益:子图里路径片段的条件熵要低,让同类问题的路收在一起;同时加规模惩罚和实体数上限,防止一块子图吞掉整张图。太小的残片并到邻居。
子图绑定智能体。优化目标是一道题尽量少跨几个智能体,每个智能体管的子图有容量上限,语义还要相近。经常在同一道题里一起出现的子图,优先塞给同一个智能体。
新问题出检索计划。用类型嵌入的余弦相似度,加上路径重叠,去训练集里找近邻。够像,就复用近邻的子问题拆法和智能体集合;不够像,按预测路径片段反查该打开哪些子图。
多智能体并行检索。被唤醒的智能体只在自己的子图里,按实体重合度匹配路径,抽出三元组,再用关系模板写成自然语言证据。
消冲突再作答。每个三元组打三项分:来源智能体的历史可靠度、多条路径上的出现频率、证据文本是否蕴含这条三元组。互相矛盾的三元组送进兼容图,求最大权团,留下互不冲突的事实。头智能体只看这批干净三元组加证据,写出最终答案。
划分信号来自历史问答走过的路径,不是图论割边。检索只激活相关分区。冲突放在聚合阶段用逻辑检查清掉,不把分辨真假交给生成模型临时发挥。
四个 KGQA 基准:WebQSP、CWQ、MetaQA-2hop、MetaQA-3hop。对照覆盖嵌入方法、不检索的纯 LLM,以及 StructGPT、RoG、ToG、SubgraphRAG、GcR 等 KG+LLM。
| 方法 | WebQSP Hit / H@1 / F1 | CWQ Hit / H@1 / F1 |
| Graph-RAG | 77.2 / 73.1 / 67.7 | 58.8 / 54.6 / 53.9 |
| RoG | 85.7 / 80.0 / 70.8 | 62.6 / 57.8 / 56.2 |
| SubgraphRAG | 86.9 / 81.8 / 71.5 | 65.4 / 61.3 / 57.8 |
| ToG | 82.1 / 78.5 / 69.8 | 63.3 / 59.8 / 56.4 |
| SPLIT-RAG | 89.4 / 85.3 / 75.6 | 66.1 / 63.0 / 60.7 |
相对最强基线 SubgraphRAG,WebQSP 上 Hit 高 2.5、Hits@1 高 3.5、F1 高 4.1。CWQ 三项仍是最好,Hit 只高 0.7,领先已经很薄。MetaQA-2hop 是 Hit 96.9、H@1 94.5;3hop 是 91.4 / 88.3。小电影图谱上 TransferNet 等嵌入方法 H@1 能到 100。论文自己说这套吃图结构和规模,搬到 Freebase 就不行。
端到端时延,同一预算下每问一次:
| 方法 | WebQSP | CWQ |
| ToG | 41.6 s | 47.6 s |
| RoG | 34.7 s | 41.3 s |
| SPLIT-RAG | 31.6 s | 35.9 s |
比 ToG 少约 10 秒,比 RoG 少 3.1 秒和 5.4 秒。WebQSP 上平均每问激活 4.6 个子图,子图大约 6.7 万实体。把有用子图合成一张、改成单智能体检索,Hits@1 从 85.3 掉到 67.9,搜索范围涨到 30.3 万实体。检索计划不用训练题相似度、改用子图标签,Hit 从 89.4 掉到 82.1,还多用子图。关掉冲突检测,Hit 掉到 85.1,跌幅最小。论文也承认冲突三元组只出现在少数问题上。
覆盖率是暗伤。子图组合能盖住 MetaQA 所需知识的 99.9%,WebQSP 是 91.3%,CWQ 只有 72.8%。训练路径盖不住的复杂多跳,分区会漏。
智能体不必一样强。MetaQA-3hop 上,子图侧用 Gemini 2.0 Flash-Lite、头智能体用 2.5 Flash Preview,Hit 92.1,耗时 28.6 秒。子图侧升到 Flash,Hit 93.9,耗时 37.1 秒。两分准确率换 8.5 秒。头要强,边上的可以瘦。
给正在做 GraphRAG 的人三条能落地的判断。
切图信号如果还停留在 METIS 那种拓扑割,可以改成「训练问题上走过的路径」。这是这篇最值得抄的部分。前提是手头有带金标路径的训练问答。没有这条监督,整套离线切图就少了锚。
检索不必全员旗舰模型。子图智能体负责抽三元组,头智能体负责合成,算力应该倾斜给头。Gemini Lite 加强头这条 Pareto 曲线,比每个 agent 都上最强模型更接近工程预算。
冲突检测有用,但不是主因。消融里它大概贡献 4 个 Hit 点。真正把 Hits@1 打回 67.9 的,是把子图合成一张再单点检索。
这是渐进改进,不是新范式。相对 SubgraphRAG 的领先在 WebQSP 上清楚,在 CWQ 上已经很薄。端到端仍要 30 秒出头,比 ToG 快,离交互式问答还远。
论文自己写了两条后续:流式图需要能在线重平衡;稀有实体上的冲突,现有逻辑检查不够用。
更大的前提写在方法里,没写进局限。切图和检索计划都依赖带金标 KG 路径的训练集。线上 RAG 很少有这条轨迹。第 3.3 节对不够像的新问题会退回预测路径,这条 fallback 没有单独指标。
CWQ 覆盖率 72.8%,说明复杂多跳上分区会漏知识。正文和表 2 的数字还对不上:正文写 WebQSP Hit 87.7、CWQ 64.2,表里是 89.4 和 66.1。以表格为准。目前没有公开代码,ACM 页眉仍是 Woodstock 2018 占位,这版就是 arXiv 预印。
复杂度写成相对整图 O(N) 降到 O((N/k) log k),推导默认用 B 树在大小为 k 的子图上查找。实测 WebQSP 平均唤醒 4.6 个子图,墙钟时延的大头更像多次 LLM 调用,不是图索引。