沃尔玛用 DPO 优化电商查询生成,砍掉 50% 无关预测
_reachsumit · x · 2026-10-06
沃尔玛团队发布 arXiv 论文 QGDPO,将直接偏好优化(DPO)应用于 Doc2Query 文档扩展,改进电商搜索相关性。
- Doc2Query 常产生与文档无关的幻觉查询或重复内容,QGDPO 先微调 seq2seq 基座,再用相关性模型对预测打分,构造胜/负偏好对进行 DPO 训练。
- 管线还用相关性模型过滤低质预测,仅保留最相关内容入库。
- 效果:相比 Doc2Query 基线消除 50% 无关预测,过滤步骤再移除 14.61%。
- 该功能已在沃尔玛全量流量上部署,相关性与用户参与度显著提升。
「研究」频道最新
- 骨骼肌肉形态空间漫游:会变形的骨架研究演示 — zzznah · 2026-10-06
- 表格基础模型怎么推理?nanoTabPFN 架构拆解笔记 — pandeyparul · 2026-10-06
- WaveFront 解码让循环语言模型提速最高 4.81 倍,无需训练 — pmttyji · 2026-10-06
- HLA-WM:免训练混合注意力,长视频世界模型记忆省12倍 — Monash · 2026-10-06
- LiFT 循环Transformer:参数省60%,FID 反降3.34点 — VISLab-Amsterdam · 2026-10-06
- GeoSET:首个SAR转光学通用基础模型,300万对训练数据 — Jeonghyeok Do · 2026-10-06