多跳检索基准测试的“商业税”:授权与成本盲区
_reachsumit · x · 2026-08-18
论文审计了顶尖的多跳检索系统,发现其最佳成绩依赖于非商业授权的嵌入模型(如 NV-Embed-v2),且通常未披露索引构建成本。研究对比了 13 个嵌入模型,指出直到 2026 年中期,最佳商业授权模型仍落后于非商业锚点模型约 2.31 个 Recall@5 点。NVIDIA 的 Nemotron-3-Embed-8B 发布后缩小了这一差距,成为唯一可自托管且性能相当的模型。此外,API 嵌入模型在每次重索引时都会产生成本,而自托管模型则无此开销。
「研究」频道最新
- KDD Cup 揭晓推荐系统大一统方案,冠军仅用 DeepSeek 搞定 — 量子位 · 2026-08-18
- Spellcaster 六 Agent 闭环:解决 AI 生成游戏不可玩难题 — 量子位 · 2026-08-18
- HumanCLAW 开源:9 个前沿 VLM 具身测试全军覆没,最高仅 16.8% — liuziwei7 · 2026-08-18
- 索引不需全精度:聚类压缩省 60 倍 — _reachsumit · 2026-08-18
- RSI Bench 发布:量化 AI 递归自我改进能力 — dhruv2038 · 2026-08-18
- Scale AI 发布 RSI-Bench,公开征集任务:每任务 2000 美元加论文共同作者 — dhruv2038 · 2026-08-18