Pinterest 用 VLM 当相关性标注员,实验灵敏度提 6 倍、成本砍 99.98%

Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

cs.IR, cs.LG

2026-08-04

搜索相关性靠人工标注又贵又慢。Pinterest 微调 Qwen3-VL 打 5 级相关性,与人工 82.9% 一致,实验最小可测效应降到原来六分之一。

这篇在解决什么

个性化搜索要同时盯两类指标:用户参与度(点击、收藏)和语义相关性。参与度会被位置、展示方式、注意力效应污染,一个个性化改动可能把参与度拉上去,同时把不相关内容塞进顶部。所以相关性是参与度之外的护栏。问题在于相关性一直靠人工标注,又贵、又慢、又难规模化,导致实验的最小可测效应(MDE,实验能可靠检出的最小指标变动)偏大,只能看出大动作,看不出细分人群或小效应。

方法

Pinterest 微调开源 Qwen3-VL(最终选 4B)当相关性打分员,输入是 Pin 图片加一整套文本元数据(标题、描述、落地页标题描述、所在画板标题、历史高互动查询),输出 1 到 5 级相关性。训练集约 80 万人工标注的查询-Pin 对,2 万留出做选型。

真正决定实验灵敏度的是采样设计,不是模型本身。用 VLM 把标注成本和周转打下来后,作者把简单随机采样换成分层采样:按查询兴趣类目乘热搜度(头部、腰部、尾部、孤例)分层,配最优分配。层间方差是相关性的主要方差来源,分层能把它消掉。指标用 sDCG@K(nDCG 的变体,假设 L5 文档无限供应),K=25,并按热搜度和类目算异质处理效应,用 Benjamini-Hochberg 控假发现率。

结果

指标数值
VLM 与人工精确一致率82.9%(94.2% 差距不超过 1 级)
二次加权 Kappa0.507
MDE1.3–1.5% → ≤0.25%(约 6 倍)
标注周转2 天 → 2 小时(大于 20 倍)
单条标注成本0.10 美元 → 0.00002 美元(降 99.98%)

4B 和 8B 表现几乎一样,选 4B 省算力;都明显好过纯文本的 XLM-RoBERTa(QWK +18.2%)。关键在配对差异误差:单组查询级误差有轻微正偏,但 treatment-control 配对后偏置基本消失,这正是它能放心用于 A/B 的原因。上线后相关性评测任务量涨到原来的 4 倍以上。多语种(法、德、葡)相关性比英文低(Kendall τ 0.36 至 0.43),但配对差异仍紧贴 0。

为什么重要

对做在线实验的人,这篇的点不在「VLM 判相关性有多准」,而在便宜标注解锁了什么样的实验设计。VLM 单条判断有约 17% 错判,绝对精度不算惊艳,但 A/B 测的是 treatment 和 control 的配对差,配对设计把模型偏置抵消掉,再靠分层加样本量把 MDE 压下去。模型是手段,实验灵敏度才是收益。这也是「LLM/VLM-as-judge」能用在线上评测的一个干净范例:用在对差异敏感的配对场景,比用在对绝对分敏感的场景稳得多。

局限与存疑

多语种相关性明显弱于英文,作者承认这是待补的差距,但没给幅度之外的诊断。QWK 0.507 只是「良好」水平,单组查询级误差虽小却真实存在,意味着它不适合直接当绝对分用,只能吃配对设计这碗饭。整篇是部署与工程论文,不是新模型架构(作者自己明说),所以方法论可迁移性依赖你能拿到类似规模的人工标注做微调底料。没有公开数据集复现。

术语

原文与代码

社区讨论

相关论文

全部论文解读