STRAP数据集发布:用冻结MLLM为200万网络图片生成区域标注

ducha_aiki · x · 2026-08-07

布拉格捷克理工大学的视觉识别研究组开源了名为 STRAP 的大规模数据集。

该数据集包含针对 200 万张网络图片(基于 CC3M 和 DataComp)的区域-文本标注。值得注意的是,这些密集描述、边界框和属性标注,仅需对冻结的开源多模态大语言模型(MLLM)进行单次前向传递即可高效生成,为图像检测、图像到文本等下游任务提供了丰富的训练资源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →