LLM 直做嵌入任务贵 1431 倍:36 个模型受控对比,总分只差 0.4
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee
COLM 2026
cs.CL
2026-08-13
COLM 2026 论文让 10 个 LLM 生成式直做 37 个嵌入任务,对比 26 个嵌入模型:总分统计打平,检索 LLM 赢 8.5 分,分类输 5.6 分,一次评测贵 1431 倍。
这篇在解决什么\n\n文本分类、语义相似度、聚类、检索,这类活的默认解是嵌入模型:把文本压成向量,近邻、余弦、k-means 一把梭。新一代 LLM 能力上来之后,一个现实的诱惑出现了:标注数据不够时,直接让 LLM 零样本把活干了,连嵌入管线都省掉。这条路值不值得走,此前没有受控答案,排行榜只报分数不报钱,两种管线也几乎没在同一批数据上跑过。\n\n这篇里的「LLM」不是拿 LLM 抽取向量,是让 LLM 生成式地直接交作业:分类直接吐标签,相似度按任务量表打分,聚类把全部文档放进一个 prompt 吐出 JSON 簇分配,检索则把整个语料库(82415 篇文档)编号塞进上下文,让模型直接报文档号。对面是 26 个专门的嵌入模型(1.18 亿到 140 亿参数)配各自的标准管线。比的是「整条管线换掉」这件事本身。\n\n方法\n\n评测集叫 MTEB(LLM),从嵌入模型业内公认的标准排行榜 MTEB 的五大类里选出 37 个任务,重做成 LLM 可作答的版本,固定种子,36 个模型跑完全一致的数据:\n\n- 分类(8 个):LLM 零样本结构化输出;嵌入侧用完整标注训练集训 kNN。\n- 相似度(10 个):LLM 直接打分;嵌入侧算余弦相似度。\n- 聚类(9 个):LLM 一次读全部文档输出簇分配;嵌入侧跑 k-means。\n- 成对分类(4 个):LLM 逐对二分类;嵌入侧余弦加事后阈值扫描。\n- 检索(6 个):LLM 走 corpus-in-context(全语料进 prompt),prompt 缓存摊薄语料前缀成本;嵌入侧余弦排序。\n\n成本核算按两侧真实部署价:LLM 按 API 牌价,输出 token(含思考 token)按输出价计,缓存命中按输入价一折;嵌入模型按 H100 spot 时租 2.49 美元折算实测最大吞吐。吞吐对比更干净:两种范式放上同一块 H100,用 vLLM 部署能塞进单卡的两个 Qwen 开源模型,消掉硬件变量。\n\n全文有一个贯穿的洞察:双编码器、交叉编码器重排、listwise LLM 重排、corpus-in-context 四种架构,区别只在一次前向能和 query 一起读多少篇文档。读得越多,每条 query 要重算的注意力越多,成本就按这个规模涨。\n\n结果\n\n| 类别 | 最佳 LLM(Gemini 3.1 Pro) | 最佳嵌入模型 | 差距 |\n|---|---|---|---|\n| 总分(37 任务) | 77.6 | Octen-8B,77.2 | 统计打平(p=0.85) |\n| 检索(6 任务) | 64.5 | Octen-8B,56.0 | LLM +8.5 |\n| 分类(8 任务) | 85.2 | SFR-2,90.8 | 嵌入 +5.6 |\n| 聚类(9 任务) | 66.6 | SFR-2,66.7 | 打平 |\n| 语义相似度(10 任务) | 88.5 | Qwen3-E-4B,88.8 | 打平 |\n| 成对分类(4 任务) | 83.2 | KaLM-12B,87.1 | 嵌入 +3.9 |\n\n总分 0.4 分的差距,经一万次配对 bootstrap 检验落在噪声里(95% 置信区间 −2.4 到 +3.1)。平局之下是干净的分工:检索是 LLM 唯一真赢的类别,六个任务赢五个,输掉的只有法律条文检索;分类上嵌入明显占优,且标签越细差距越大(Banking77 有 77 个类、MassiveIntent 有 60 个意图)。不思考的 Gemini 3.1 Flash-Lite 总分 64.5,低于多数嵌入模型。\n\n价差是另一个量级。跑一遍这套基准,Gemini 3.1 Pro 花 154.14 美元,Octen-8B 花 0.11 美元,1431 倍;换商业嵌入 API 或 L4 GPU 等计价假设,倍数在 3382424 之间浮动。最便宜的 LLM(DeepSeek-V4-Flash,3 美元)总分 68.5,仍低于最好的嵌入模型。同一块 H100 上,Qwen 每秒处理 54005900 个 token,嵌入模型从 14700 到 430 万不等,差 2.5736 倍。\n\n成本大头是思考 token,在带思考能力的模型里占推理成本的 28%81%。把 reasoning 调低或关掉,生成 token 减少 54%96%:Gemini 3 Flash 六个检索任务分数全部持平或上涨,跨家族抽的六个模型里四个检索均分不掉,分类变化不超过 1 分。例外是两个 Qwen,关掉思考后掉分。默认思考预算在这类任务上大半是白烧的。\n\n工程上最有用的是重排实验:推理密集的 BRIGHT 基准上,LLM listwise 重排器把强嵌入模型的第一阶段从 22.3 提到 35.1 nDCG@10,重排 top-100 只要 1030 美元,MoE(混合专家)的 Qwen3.6-35B-A3B 花 10 美元拿到 33.6;语义型的 BEIR 上,强嵌入单级 63.1 反而高于所有重排组合(最佳 60.3)。想给检索加推理,重排一个候选列表比把整个语料塞进上下文便宜一个数量级。\n\n为什么重要\n\n这篇给了可以直接照抄的分工:相似度、分类、聚类继续用嵌入模型,只有推理密集型检索值得上 LLM,而且上法是「嵌入召回加 LLM 重排 top-k」,不是全语料进上下文。做 RAG 的人可以直接拿它定预算。\n\n方法论上,它用数字证明了 accuracy-only 排行榜会掩盖同分段系统之间上千倍的成本差,主张把 Pareto 前沿和显著性检验放进榜单;评测集按 MTEB 框架发布,后续模型可以接着跑。\n\n思考预算的浪费也量化了。28%81% 的推理成本花在思考上,多数任务关掉不掉分,这个结论对一切按 token 付费的负载都成立,不止嵌入场景。\n\n局限与存疑\n\n作者列了六条局限,分量最重的三条:\n\n- 检索协议只在小语料(82415 篇)上成立,整个语料库能塞进 prompt 本身就是 LLM 的结构性便宜;生产规模必须先有索引第一阶段,报告的成本差距因此只是下界。\n- 监督不对称:嵌入侧 kNN 用了完整标注训练集,LLM 只拿任务描述加最多五个示例,分类上的 5.6 分差距有相当部分来自这个设定。作者承认做过分类后训练的 LLM 可能缩小差距,只是 frontier 模型里没有这样的。\n- GPT-5、Claude Opus 4.6 都不在十个 LLM 里,前沿快照已经落后。\n\n读下来另有两处要留神。多数头部嵌入模型在这些任务的域上做过对比训练,部分领先是在域内拟合而非表征能力,作者提了但没量化。总分对 37 个任务等权,换加权方案,「打平」的结论可能挪动。\n\n术语\n\n- MTEB:大规模文本嵌入基准,嵌入模型业内公认的标准排行榜。\n- kNN 分类:拿标注样本的向量找最近邻定标签,不需要微调模型。\n- corpus-in-context:把整个语料库编号后放进 prompt,让 LLM 直接选出相关文档。\n- listwise 重排:一次读入 top-k 候选整体比较后重排,与逐对打分的交叉编码器相对。\n- Pareto 前沿:成本-质量平面上,不被任何方案同时更便宜又更好的方案集合。\n- nDCG@10:排序指标,衡量前 10 名里相关文档命中的位置加权质量。
原文与代码
社区讨论
相关论文
全部论文解读