STRAP数据集发布:用冻结MLLM为200万网络图片生成区域标注
ducha_aiki · x · 2026-08-07
布拉格捷克理工大学的视觉识别研究组开源了名为 STRAP 的大规模数据集。
该数据集包含针对 200 万张网络图片(基于 CC3M 和 DataComp)的区域-文本标注。值得注意的是,这些密集描述、边界框和属性标注,仅需对冻结的开源多模态大语言模型(MLLM)进行单次前向传递即可高效生成,为图像检测、图像到文本等下游任务提供了丰富的训练资源。
「多模态」频道最新
- Suno 移动端上线 Voices 功能,支持录制人声生成音乐 — suno · 2026-08-07
- Seedance 视频生成实战:先用 2.0 Mini 草拟再转 2.5 精修 — Div_pradeep · 2026-08-07
- Lovart集成Seedance 2.5:支持50个参考图与30秒长视频 — AIwithGhotai · 2026-08-07
- PixVerse启动PixLight AI电影节,总奖金池30万美元 — umesh_ai · 2026-08-07
- 字节推出 Seedance 2.5 企业 API,支持 30 秒长视频 — nikola_mr64990 · 2026-08-07
- AI 生成视频混剪:《毁灭战士》血战《闪灵》酒店 — ctrl-shift-face · 2026-08-07