The Commercial Tax: Rent-vs-Own Blind Spots in Multi-Hop Retrieval Benchmarks
Luis M. Sanchez, Kosrow Dehnad
cs.IR, cs.CL
2026-08-17
实测 13 个 embedding 模型发现多跳检索领先系统依赖非商用底座;2.31 点的商业税已被 Nemotron 抹平,真正烧钱的是图索引而非 embedder。
企业接 RAG,选型时看的是多跳检索基准的排名。这篇换了个买家视角:榜单数字背后,这套系统你能不能合法部署、要花多少钱建。两个答案都不乐观。领域公认的 dense-retrieval anchor(基线检索模型)NV-Embed-v2 采用 cc-by-nc-4.0 许可,禁止商用,根因是训练数据里用了非商用的 MS MARCO 语料,NVIDIA 自己在 HuggingFace 讨论区确认过这一点。审计的四个领先 MuSiQue 系统(HippoRAG-2、PropRAG、SAG、KET-RAG)里,三个的最佳数字依赖它,没有一个披露;SAG 的头条 80.0% Recall@5 用的是 MIT 许可的 BGE-Large,但它自己的消融里换上 NV-Embed-v2 能到 81.7%,恰是协议内最高分。成本一侧,五个被审计系统(加 Microsoft GraphRAG)有三个不给索引成本。
两条线。性能线:13 个 embedder、8 家厂商(NVIDIA、OpenAI、Google、Cohere、Voyage、阿里、BAAI、Mixedbread),全部跑在同一套 MuSiQue harness 上(11,656 段 Wikipedia、1,000 道多跳题),纯稠密检索、暴力余弦、无 ANN 索引,全程 percentile bootstrap 置信区间(重采样 10 万次)。成本线:把一次性 embedding 成本与经常性回答成本拆开建模,再把各系统披露的美元数按每 MB 费率外推到 5GB、100GB、1TB。
| 对比 | 指标 | 结果 |
| NV-Embed-v2(实测) | Recall@5 | 69.55 |
| Nemotron-3-Embed-8B | Recall@5 | 69.79(差 +0.24,p=0.69,统计不可区分) |
| Gemini embedding-001 | Recall@5 | 67.24(2026 年 6 月前最佳商用,落后 2.31 点,p=0.001) |
| 开源组(Qwen3-VL、mxbai、BGE-M3) | Recall@5 | 54.93-59.88,落后 9.7-14.6 点 |
所谓商业税,指用商用许可 embedder 要交的质量罚金。2026 年 6 月它是真实存在的 2.31 个 Recall@5 点;NVIDIA 7 月 16 日发布的 Nemotron-3-Embed-8B 把它抹平了,而且是面板里唯一同时满足商用许可、可免费自托管、与 anchor 统计不可区分的选手。n=1,000 只能分辨约 1.7 点以上的差距,严谨的说法是税已小到测不出,不是税为零。
成本侧的数字更扎眼:同一份 5.64MB 语料,GraphRAG 仅有的公开美元标价在 2.30 美元(低成本配置)与 24.94 美元(高性能配置)之间,相差 11 倍,而 Microsoft 自己的论文一个美元数都没给;线性外推到 1TB,这个未披露的配置选择就是 42.8 万与 460 万美元的差别。1TB 规模下 embedding 成本只有图构建的 1/7.5 到 1/900,每天一万次查询跑一年的回答成本再低 350 倍以上。钱在索引架构,不在 embedder。
对选型的人,这篇折成四个可以直接问供应商的问题:embedding 模型的许可是什么、索引一次多少钱、能否自托管、数字是在什么 harness 上测的。更持久的发现能扛过下一次模型更新:API embedder 每次 re-index 都按 token 收费(10GB 语料 46-346 美元),自托管开源模型为 0。embedding 选型本质是许可与数据主权决策,成本决策在图构建那头。
作者的自述相当坦诚:单一基准单一语料;成本线性外推对图构建几乎肯定失真,真实开销可能更高;面板 13 个里 5 个是 NVIDIA 模型;各家获得的 query 格式尝试次数不均(anchor 扫 4 个变体取最优,Nemotron 只测单配置),这个偏差方向对结论不利,属保守估计;hosted endpoint 可能被服务端静默更换,实测 text-embedding-3-large 两轮间漂了 0.54 点;预注册只有文内声明,没有外部注册。另外所有 recall 是无索引暴力检索的上限,生产环境 ANN 会还回去一部分;BGE-M3 只测了 dense 模式,倒数第二的排名不能给它的混合检索模式定罪。查询格式一项就能让 Qwen3-VL 波动 11.6 点,文献里跨 harness 抄数字的惯例因此更可疑了。