两尺寸共享向量空间:9B 编码文档、0.6B 服务查询

tomaarsen · x · 2026-10-08

pplx-embed-v2-late 的 0.6B 与 9B 共享嵌入空间,可先用 9B 离线编码整个语料库,再用 0.6B 在线服务查询,以低成本逼近大模型效果。两模型均由同一个 18B 教师模型通过对齐逐 token 嵌入蒸馏而来,小模型可直接检索大模型的文档向量。同线程还说明架构:基于 Qwen3.5 双向注意力,每个 token 保留一个 128 维向量,MaxSim 让查询不同部分匹配页面不同部分,Sentence Transformers 中用 model.similarity()。

所属事件:Perplexity 开源多模态嵌入模型 pplx-embed-v2-late(38 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →