新论文证明:向量检索几何上容易,学习查询编码器却可能指数级难
_reachsumit · x · 2026-10-05
arXiv 论文(2610.02749)研究向量检索的"几何容量"新定义——冻结的文档索引所能达到的最大召回率。实证发现:在多个真实基准上,单向量查询编码器的检索质量远低于文档索引本身能支持的上限。理论上,作者构造了一个检索任务:存在一个单隐层小型 ReLU 网络即可完美表达的查询编码器,但任何统计查询学习器(通过聚合统计访问训练数据的一类算法)要超过随机基线 k/n 的非平凡召回优势,都需要指数级数量的统计查询。结论:检索基准存在大量未实现的几何容量,查询编码器的可学习性本身是硬问题。
「研究」频道最新
- 训练进执行 harness,Qwen3-14B 在 Spider 2.0 从 22.2% 飙到 54.8% — omarsar0 · 2026-10-11
- REMAG 发布:磁性材料 DFT 计算 GPU 化,特定化合物提速达 111 倍 — CatAstro_Piyush · 2026-10-11
- Yoav Goldberg 炮轰 COLM: RL 损失微调算不上科学 — yoavgo · 2026-10-11
- 斯坦福研究:Agent 循环卡顿改 harness,计划差就得训权重 — rohanpaul_ai · 2026-10-11
- 哈佛医学院 ToolUniverse 工作坊:给 AI 配 2700 个科学工具造 AI 科学家 — marinkazitnik · 2026-10-11
- Mark Tenenholtz:RLVR 易得红利枯竭,「品味」类任务成下一前沿 — marktenenholtz · 2026-10-11