腾讯 WeMM 多模态嵌入模型发布,支持图文视频统一检索
tomaarsen · x · 2026-09-02
腾讯团队在 Hugging Face 上发布 WeMM-Embedding 系列(2B/4B/9B),主打混合媒体检索,尤其是视频语料场景。亮点包括:
- 多模态文档表示:一个输入可交错包含多张图片或多个视频,文档侧支持 {"video": ..., "text": ...} 形式的混合输入。
- Matryoshka 截断:支持截断嵌入维度,得到更小更快的向量。
- 使用方式:SentenceTransformer("tencent/WeMM-Embedding-9B", trustremotecode=True),分别调用 encodequery / encodedocument。
配套技术报告(arXiv 2608.24053)已发布,2B 版下载量已超 7k。
所属事件:腾讯开源 WeMM-Embedding 多模态嵌入模型,登顶 MMEB 榜单(6 条相关)→
「模型」频道最新
- 爆料称 9 月将有两款重磅开源模型发布 — lqiao · 2026-09-02
- Bug Hunt 榜单:Fable 5.1 low 更便宜且胜过 Opus 5 max — PawelHuryn · 2026-09-02
- Gemini 3.8 Flash 现身 GCP Agent Studio,主打多模态与编码场景 — testingcatalog · 2026-09-02
- 某模型 ARC-AGI-2 得分 90%,单任务成本降至 3.12 美元 — eyishazyer · 2026-09-02
- 用户吐槽 GPT 近几周八成回答以「Yes」开头 — Standard-Metal-3836 · 2026-09-02
- Fable 5.1 修复前代模型荒唐决策:每次按键都对图标像素做 SHA-256 — johnlindquist · 2026-09-02