相册检索要组故事不是单张打分,BundleWeaver精确匹配到7.2%

Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching

Rong Shan, Tianyi Xu, Congmin Zheng, Wenteng Chen, Jiachen Zhu, Junjie Wu, Teng Wang, Weiwen Liu, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

EMNLP'26 Main Conference

cs.CV, cs.IR

2026-08-27

新任务IBC要从十万级相册组成有关系的图像束。最强嵌入F1约15,静态分解重排F1为23.74、精确匹配1.50%;BundleWeaver增量补齐缺失角色,F1到30.28,精确匹配7.20%。

这篇在解决什么

图文检索默认把每张图单独打分。MSCOCO、Flickr30K到后来的多跳视觉检索,终点仍是一张张互不约束的图。私人相册里的查询往往不是「找一张埃菲尔铁塔」,而是「铁塔从白天转到夜里」或「一场演出的几个高潮」。目标是一小束图,彼此靠时间进程、事件摘要或空间连续性绑在一起,单张分高也可能组合失败。

新任务叫Image Bundle Composition。候选束不是预先建好的索引,任意子集都可能构成答案,搜索空间大约是N的Kmax次方。束级相关性也不能写成单张分数的单调加总:两张高分白天照加不出昼夜过渡。

方法

IBCBench从YFCC-100M里留下109467张带时空元数据的照片,先按用户时空会话切滑动窗口,再用Claude Opus 4.5按关系模板核验,四人标注去歧义。终集667条查询,端到端接受率低于9%。束大小3、4、5张分别占24.3%、32.2%、43.5%;同地动态52.5%,跨地结构47.5%。合格束要满足联合完备、跨图约束、全局尽量唯一、图与图视觉不重复。

BundleWeaver把任务写成查询条件下的超边发现。LLM先抽出视觉锚点做多样种子,避免挤在近重复上。每条分支用束搜索往前长:LLM根据当前部分束生成指向缺失角色的子查询,在种子附近的时空邻域里取候选,打分同时看逐步匹配和整束与原查询的对齐。束完成后由VLM对整束打1到10的结构一致性分,取最高超边。搜索有上限深度,不穷举子集。

结果

点对点多模态嵌入几乎做不成这件事。CLIP-ViT-B/32的F1是2.21,精确匹配0;最强的RzenEmbed F1 14.88,精确匹配0.30。字幕加文本嵌入和会话、时空启发式重排同样低,硬套时空过滤还会把F1打下去,说明近不能代替角色补齐。

静态「分解查询再独立检索、最后重排」是最强基线族。Claude Sonnet 4.5拿到F1 23.74、精确匹配1.50%;GPT-4o是17.84和0.60。召回被分解抬起来了,精确匹配仍然惨,因为子查询之间没有跨图约束。

BundleWeaver F1 30.28、精确匹配7.20,相对最佳基线精确匹配高出约3.8倍,Precision/Recall/F1相对提升24.8%、32.4%、27.5%。去掉多样种子、候选剪枝、束搜索或VLM整束重排,F1分别落到27.21、24.69、25.35、26.13,每一项都还高于GPT-4o的分解基线。换Qwen3-VL-235B、Gemini 3 Flash、Claude、GPT-4o当骨干,精确匹配都从低于2%跳到4.35%至7.20%。束越大所有方法都掉,增量扩张掉得少一些。

为什么重要

相册类产品如果还在用CLIP把query打成top-k,会稳定地交出让人觉得「每张都有点像、连不成故事」的结果。IBC把评价单位改成集合:精确匹配才算讲对了那件事。BundleWeaver说明训练免费的agent流程就能把精确匹配从约1.5%抬到7.2%,靠的是补缺失角色和整束校验,不是换一个更大的嵌入模型。7.2%离能用还早,方向已经和原子打分不在一条路上。

局限与存疑

667条查询全来自YFCC私人相册,医疗序列、法律证据、视频连续时间都没做。束是3到5张、由滑动窗口挖出来的,真实用户的K和关系类型会更野。标注锚定时空会话,评测里的候选剪枝也用时空邻域,有泄漏结构的嫌疑;消融显示剪枝很有用,但去掉之后仍明显强过分解基线。方法零样本调用前沿VLM,成本和时延没有当成一等指标。精确匹配7.2%说明组合约束极难,benchmark本身可能偏「唯一答案」,真实相册里合理束往往不止一个。没有端到端微调。

术语

原文与代码

相关论文

全部论文解读