美团搜索3.0实践:LLM语义表征三期迭代,长尾NDCG提升2.21pp

美团技术团队 · wechat · 2026-08-20

美团搜索团队介绍在服务零售排序场景三期引入 LLM 语义表征的实践:用 LLM 为 Query、商家(POI)、商品生成语义向量,以 cosine 相似度分桶注入精排模型,弥补传统文本匹配在长尾品类上的语义 Gap。

一期(验证可行性):小参数基座+全参微调,设计三个特殊 Token(|query|/|item|/|qi|)作聚合锚点,通过 AttentionMask 三次 ForwardPass 实现信息隔离;双 Loss(匹配二分类+CTR)协同训练,3000 万样本。cosine 相似度分 10 桶、每桶 12 维可学习 Embedding 注入精排。线上大盘订单 +0.20%,长尾 NDCG@5 +2.21pp、BadCase@1 -2.96pp。

二期(系统升级):针对一期四个短板重构全流程——训练样本扩展为含难负样本的五元组(同请求未点击样本作难负,2766 万条);发现反直觉结论:精简信息陈述+总结引导的 Prompt 优于复杂任务指令,CPV 属性信息反而带来噪声;基座转向中等参数 Embedding 模型+LoRA 微调(r=8),且 LoRA 在 NDCG 上优于全参微调;表征提取从三 Token 单序列改为独立序列+可学习向量,并将商品(Deal)纳入建模,构建 Query-POI-Deal 三元表征体系。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →