阿里巴巴 H+ Embedding 少用 13.7% 向量,检索接近 token 级

_reachsumit · x · 2026-08-04

阿里巴巴提出 H+ Embedding,在全局向量检索和 token 级检索之间加入“上下文相关短语”这一中间粒度。

论文认为,术语密集型检索需要比单一 embedding 更细、但又比完整 token late interaction 更便宜的表示。H+ Embedding 会预测可变长的短语切分,把未覆盖到的 token 保留为单独单元,并用重要性引导的选择与加权 MaxSim 互动。在 16 个科学、医疗和双语任务上,短语分支比全局分支高出 6.91 个宏平均 nDCG@10,几乎追平 token 级方案,同时只用少 13.7% 的文档向量。作者将其视为在压缩质量与索引/打分成本之间更实用的中间方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →