RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin
cs.CL, cs.AI
2026-07-13
现有 GraphRAG 一次抽取产生噪声实体和脆弱检索;RAGU 把建图拆成多步(实体关系分阶段、聚类去重),配一个 7B 的「用上下文而非记忆」小模型,建图成本从 GPT-4o 的约每篇 0.1 美元压到本地约 0.001 美元。
图检索增强(GraphRAG)给 LLM 加结构化知识,但现有系统一次抽取就建图,产出噪声大、重复多的实体,检索脆弱。实践者默认用 GPT-4 级的大 API 模型,这建立在一个错误前提上:RAG 管线里 LLM 要的能力(理解、抽取、上下文推理)是语言技能,不是事实记忆,而事实记忆才随参数量线性涨,语言技能涨得慢。论文在 Qwen2.5 系列上测:从 0.5B 到 72B,CheGeKa F1 涨 21.1 倍(靠记忆),MultiQ 只涨 4 倍(靠语言技能)。开源框架还有安装失败、对 LLM 原始输出跑 eval() 这类工程问题。
建图分六步。切块(三种 chunker);两阶段抽取(先抽实体、验过 NEREL schema 的 29 种实体类型和 49 种关系类型,再抽关系并要求两端实体必须是已验过的);聚类去重(EntitySummarizer 按名字加类型分组、DBSCAN 聚类、LLM 摘要合并重复),在社区检测之前降噪,这是单步系统(如 LightRAG)缺的一步;然后是 Leiden 社区聚类、社区摘要、精修。
小模型 Meno-Lite-0.1 是 7B,基于 RuadaptQwen2.5-7B-Lite-Beta,继续预训练 13 亿 token(俄英教育和科学文本),监督微调 5000 万 token(NEREL 抽取、多跳问答、查询日志)。关键是微调教模型「用上下文而非回忆事实」,把算力投在语言技能上而非世界知识。它有 128K 上下文(128K 处 passkey 检索 0.98),俄语分词效率高 47%。
引擎设计上,三层存储抽象(图、KV、向量)加生命周期回调、异步优先 API、Pydantic v2 校验结构化输出(去掉手写 JSON 后处理)、五种检索引擎(Local、Global、Naive、Mix、QueryPlan)。
GraphRAG-Bench(医疗领域),建图和回答都用 Meno-Lite-0.1:
| 系统 | 事实检索 AC | 复杂推理 AC | 上下文摘要 AC | 创作生成 AC | 覆盖率 |
| LightRAG | 26.2 | 20.2 | 22.6 | 14.4 | 3.9 |
| HippoRAG 2 | 72.4 | 68.4 | 65.0 | 56.9 | 34.7 |
| RAGU | 54.2 | 53.7 | 64.1 | 59.0 | 57.4 |
事实检索和复杂推理上 HippoRAG 2 更强,但 RAGU 覆盖率高得多(57.4 对 34.7),到了需要广度综合的创作生成上反超 HippoRAG 2(59.0 对 56.9)。证据召回率 RAGU 在每个事实层级都最高(84,对手最多 76)。
信息抽取基准上,7B 的 Meno-Lite-0.1 调和均值 0.468,比 Qwen2.5-32B(0.416)高 12.5%。
成本上,每篇文档 MS-GraphRAG(GPT-4o)约 4 万 token、约 0.1 美元;RAGU 加 Meno-Lite-0.1(本地)约 8000 token、固定 GPU 成本约 0.001 美元。10 万篇文档:约 1 万美元对约 100 美元,差两个量级。
把 GraphRAG 从「必须用最贵的大模型建图」变成「用 7B 小模型本地建图」,成本降两个量级。对要大规模落地的团队,这套多步降噪加小模型只练语言技能的思路比换更大模型更省钱。引擎本身开源、模块化,三种存储后端可换。
「语言技能不随规模涨」这个核心论据只在一个模型族(Qwen2.5)和部分任务上验证,论文自己也说这是有支撑的假设,不是普适定理。Meno-Lite-0.1 拿参数记忆换上下文接地,不能当独立知识库用,32K 之后多跳推理会退化。监督微调用了 NEREL 训练和验证集,基准用的是同源的留出测试集,论文承认无法完全排除分布重叠带来的残余优势。默认 NetworkX 后端撑不住百万节点级语料,要接专门图数据库。最终图质量对抽取 LLM 仍敏感,弱基座模型引入的结构噪声聚类补救不了。