GraphRAG 用 30B 以下模型跑马拉地语:跨文档多跳推理显著胜出
kmeanskaran · x · 2026-08-18
作者在马拉地语(Marathi)政府方案文档上系统对比了 GraphRAG 与 VectorRAG,核心发现:GraphRAG 在跨文档多跳推理上表现异常出色。
- 数据与设置:29 份马拉地语方案文档,两条流水线使用完全相同的文本与同一个编码器(nomic-embed-text-v2-moe);GraphRAG 用 LLM 抽取 SPO 三元组建到 Neo4j(Entity-[:REL]->Entity),VectorRAG 则切块存入 ChromaDB 取 top-5。
- 评测集:36 道题,其中 20 道跨文档多跳、8 道不可回答的陷阱题、6 道单文档多事实题、2 道直接事实题;28 道需要跨文档推理,每题都标注了 bridgeentity 与 bridgepath。
- 实验分一跳(直接事实)与两跳(A→枢纽→B)查询,测试均由 30B 以下模型驱动,证明小模型配合图结构也能撑起复杂推理。
所属事件:研究显示 GraphRAG 跨文档多跳推理显著胜过 VectorRAG(2 条相关)→
「研究」频道最新
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24