腾讯发布通用多模态嵌入模型,登顶 MMEB 榜单

NielsRogge · x · 2026-08-25

腾讯在 Hugging Face 上发布了一个通用多模态嵌入模型,可将文本、图像、视频与视觉文档映射到同一表示空间,在 MMEB v2 与 v3 上达到 SOTA。

据 Niels Rogge 对比,该模型在 COCO 图文检索(image-to-text retrieval)上还击败了 Meta 上周刚发布的 MoE 视觉模型,登顶 Papers with Code 榜单。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →