SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions
Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang
EMNLP 2026
cs.CV, cs.IR
2026-08-30
港科广与腾讯元宝用1145条查询、53种损坏测16个多模态检索器。图侧损坏最伤,联合检索平均比纯图低11.21点;MOOR按分数重加权,只比白化纯图高0.43点。
手机拍照问一句「这是什么花」,系统要从图库里把那一种花排到最前面。图经常糊、裁切、有水印,问题又短又粗,打错字也常见。现有检索评测要么用干净的图文对,要么单独扰动图或文本,而且扰动之后换了一道题。这样看不出「同一张图、同一个意图,只是拍糊了」到底掉多少。
SnapBench 把这件事做成配对测试:干净样本和损坏样本共用同一意图、同一图库、同一标注。来自港科广、腾讯元宝、清华、港大,投稿 EMNLP 2026。
先从网页图池筛出带明确主体的查询图,Gemini-3-Flash 写粗粒度英文问题,规则加 GPT-5.4-mini 过筛,留下 1,145 条。图库从同一池另采,用私有 Qwen-VL 写实体描述,再由检索系统预召回 top-30,人工按视觉相似、实体相关、标题准不准、是否贴合意图打 0 到 3 分。fitness ≥ 2 当正例,= 1 当难负例,= 0 踢出图库。最终 9,085 条图库、正例均 4.77 条、难负例均 3.50 条。十名标注员校准准确率至少 90%,终审通过率 95%。
损坏只动查询、不动图库。图侧 15 个算子、4 类(Add / Remove / Degrade / Transform)、3 档强度,共 45 种;文本 8 个规则算子,覆盖增删改换字、词重复和对调、句首加口语、整句换成 “What is this?”。再挑 6 组图文同时损坏。一共 53 种受控条件。
MOOR 是训练免费的融合探针。它对四条相似度路径(图-图、文-文、图-文、文-图)做图库白化,用与图-图路径的 Pearson 相关过铃形门,再按分数方差加权。没有可学参数。
16 个模型干净 R@1 从 39.8(SigLIP2-SO400M)到 79.1(Ops-MM-7B),没有一家过 80。VLM embedding 平均比双塔高 13 点。
图损坏把 16 模型平均 R@1 从 63.2 打到 57.9。强度 s1 / s2 / s3 分别掉 0.8、3.8、11.2 点。s3 时 Remove 最狠(16.3),然后是 Degrade 12.5、Add 10.9,几何变换只有 5.2。干净成绩排不出来谁抗损坏:SigLIP-SO400M 干净很高,重损坏掉得也狠。
文本损坏几乎不动联合检索,字符、词、句三档平均 63.5、63.7、63.9。这不是文本鲁棒,是文本根本没怎么被用。联合检索(IT→IT)多数时候不如纯图(I→I),16 模型平均拖累 11.21 点。GME-7B 上把「What flower is this?」换成「A tulip.」,拖累从 7.68 收到 0.17,消掉 97.8%。粗粒度才是祸首。
图文一起坏更不是两边相加。六组联合条件上,观测掉分 13.6,单侧相加只有 6.0,超加性缺口 7.6 点。GME 最明显,Ops-MM 和 VLM2Vec 呈亚加性。
MOOR 在 54 个状态、16 个模型上平均 R@1 69.80,高于白化等权融合 60.72、RRF 45.64,只比白化纯图 69.38 高 0.43,距 oracle 80.07 还有 10 点。CLIP 平均能抬 6.0,Qwen3-VL-2B 只有 0.5。它补回 oracle 缺口的 40% 到 60%,双塔受益更大。
拍照即问已经是手机 AI 的入口,但多数检索系统还在用固定融合。粗问题会把同类难负例分数一起抬上去,把本来清楚的视觉排序搅乱。对做产品的人,默认「图加字一定更好」在这个场景不成立;先看纯图,文本只在真正有区分信息时再加重,更接近这篇的结论。
MOOR 能当诊断工具,用来检查固定融合有没有把不可靠的模态加权过头。它几乎没超过白化纯图,说明校准的上限在这个基准上很接近「相信图像」。
损坏是程序生成的,不是从真实糊图里爬来的。作者用 5,000 条真实上传做过信号统计,71% 至少一侧有问题、35% 两侧都有;另用 200 张真实损坏验证,Degrade 和 Remove 仍然最伤(R@1 掉 9.8 和 12.4)。真实联合分布仍可能和因子设计不一样。
规模刻意做小,1,145 查询换来的是密标注和难负例,不是 web 级体量。查询问题由模型生成、再人工把关,和真实用户打字分布会有偏差。MOOR 在两路信号都好或都坏时退回固定融合,本身不提供增益。评测只覆盖检索这一步,不覆盖后面的回答生成。