RAGU 多步建图加 7B 小模型,GraphRAG 建图成本压两个量级

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin

cs.CL, cs.AI

2026-07-13

现有 GraphRAG 一次抽取产生噪声实体和脆弱检索;RAGU 把建图拆成多步(实体关系分阶段、聚类去重),配一个 7B 的「用上下文而非记忆」小模型,建图成本从 GPT-4o 的约每篇 0.1 美元压到本地约 0.001 美元。

这篇在解决什么

图检索增强(GraphRAG)给 LLM 加结构化知识,但现有系统一次抽取就建图,产出噪声大、重复多的实体,检索脆弱。实践者默认用 GPT-4 级的大 API 模型,这建立在一个错误前提上:RAG 管线里 LLM 要的能力(理解、抽取、上下文推理)是语言技能,不是事实记忆,而事实记忆才随参数量线性涨,语言技能涨得慢。论文在 Qwen2.5 系列上测:从 0.5B 到 72B,CheGeKa F1 涨 21.1 倍(靠记忆),MultiQ 只涨 4 倍(靠语言技能)。开源框架还有安装失败、对 LLM 原始输出跑 eval() 这类工程问题。

方法

建图分六步。切块(三种 chunker);两阶段抽取(先抽实体、验过 NEREL schema 的 29 种实体类型和 49 种关系类型,再抽关系并要求两端实体必须是已验过的);聚类去重(EntitySummarizer 按名字加类型分组、DBSCAN 聚类、LLM 摘要合并重复),在社区检测之前降噪,这是单步系统(如 LightRAG)缺的一步;然后是 Leiden 社区聚类、社区摘要、精修。

小模型 Meno-Lite-0.1 是 7B,基于 RuadaptQwen2.5-7B-Lite-Beta,继续预训练 13 亿 token(俄英教育和科学文本),监督微调 5000 万 token(NEREL 抽取、多跳问答、查询日志)。关键是微调教模型「用上下文而非回忆事实」,把算力投在语言技能上而非世界知识。它有 128K 上下文(128K 处 passkey 检索 0.98),俄语分词效率高 47%。

引擎设计上,三层存储抽象(图、KV、向量)加生命周期回调、异步优先 API、Pydantic v2 校验结构化输出(去掉手写 JSON 后处理)、五种检索引擎(Local、Global、Naive、Mix、QueryPlan)。

结果

GraphRAG-Bench(医疗领域),建图和回答都用 Meno-Lite-0.1:

系统事实检索 AC复杂推理 AC上下文摘要 AC创作生成 AC覆盖率
LightRAG26.220.222.614.43.9
HippoRAG 272.468.465.056.934.7
RAGU54.253.764.159.057.4

事实检索和复杂推理上 HippoRAG 2 更强,但 RAGU 覆盖率高得多(57.4 对 34.7),到了需要广度综合的创作生成上反超 HippoRAG 2(59.0 对 56.9)。证据召回率 RAGU 在每个事实层级都最高(84,对手最多 76)。

信息抽取基准上,7B 的 Meno-Lite-0.1 调和均值 0.468,比 Qwen2.5-32B(0.416)高 12.5%。

成本上,每篇文档 MS-GraphRAG(GPT-4o)约 4 万 token、约 0.1 美元;RAGU 加 Meno-Lite-0.1(本地)约 8000 token、固定 GPU 成本约 0.001 美元。10 万篇文档:约 1 万美元对约 100 美元,差两个量级。

为什么重要

把 GraphRAG 从「必须用最贵的大模型建图」变成「用 7B 小模型本地建图」,成本降两个量级。对要大规模落地的团队,这套多步降噪加小模型只练语言技能的思路比换更大模型更省钱。引擎本身开源、模块化,三种存储后端可换。

局限与存疑

「语言技能不随规模涨」这个核心论据只在一个模型族(Qwen2.5)和部分任务上验证,论文自己也说这是有支撑的假设,不是普适定理。Meno-Lite-0.1 拿参数记忆换上下文接地,不能当独立知识库用,32K 之后多跳推理会退化。监督微调用了 NEREL 训练和验证集,基准用的是同源的留出测试集,论文承认无法完全排除分布重叠带来的残余优势。默认 NetworkX 后端撑不住百万节点级语料,要接专门图数据库。最终图质量对抽取 LLM 仍敏感,弱基座模型引入的结构噪声聚类补救不了。

术语

原文与代码

相关论文

全部论文解读