阿里巴巴 H+ Embedding 少用 13.7% 向量,检索接近 token 级
_reachsumit · x · 2026-08-04
阿里巴巴提出 H+ Embedding,在全局向量检索和 token 级检索之间加入“上下文相关短语”这一中间粒度。
论文认为,术语密集型检索需要比单一 embedding 更细、但又比完整 token late interaction 更便宜的表示。H+ Embedding 会预测可变长的短语切分,把未覆盖到的 token 保留为单独单元,并用重要性引导的选择与加权 MaxSim 互动。在 16 个科学、医疗和双语任务上,短语分支比全局分支高出 6.91 个宏平均 nDCG@10,几乎追平 token 级方案,同时只用少 13.7% 的文档向量。作者将其视为在压缩质量与索引/打分成本之间更实用的中间方案。
「Infra」频道最新
- 单台 DGX Spark 成功跑通 MiniMax H3 视频生成 — Scobleizer · 2026-08-04
- ComfyUI 集成 Spectrum 加速:MiniMax H3 推理时间最高降低 34% — marres · 2026-08-04
- 报告预测 DRAM 与 NAND 存储芯片价格将在 2027 年触顶 — SumitGup · 2026-08-04
- 硅悬键造出原子级逻辑电路,量子线态工程新论文发布 — teortaxesTex · 2026-08-04
- 缓存命中率仅差 5%,Token 成本为何暴增 3-4 倍? — Xianbao_QIAN · 2026-08-04
- 生产级 LLM 应用必备:AI Gateway 核心功能探讨 — Fun-Beginning5005 · 2026-08-04