腾讯发布 WeMM-Embedding 多模态模型,2B 版超越 8B 基线
_reachsumit · x · 2026-08-26
腾讯发布了 WeMM-Embedding 技术报告,这是一系列通用的多模态嵌入模型,支持文本、图像、视频、视觉文档及任意交错的多模态输入。该系列包含 2B、4B 和 9B 三种规模的变体。训练分为两个阶段:大规模多模态对齐阶段,以及使用精选数据、细粒度相关性监督和跨尺度知识迁移的微调阶段。在评估中,WeMM-Embedding 在多个公共基准上取得了领先成绩:2B 版本在 MMEB-v2 上超越了此前领先的 8B 开源基线,9B 版本更是取得了 80.6 的全新 SOTA 总分。该模型已在微信视频号、公众号、朋友圈和电商服务等多个场景的大规模推荐与搜索应用中部署,并带来了显著收益。
所属事件:腾讯发布 WeMM-Embedding 多模态嵌入模型系列(5 条相关)→
「多模态」频道最新
- OraRL:高效可扩展的视频 MLLM 强化学习 — Yunheng Li · 2026-08-26
- 如何快速生成MiniMax高清视频?求不牺牲质量方案 — OkMeat6773 · 2026-08-26
- 用 Google Gemini 生成女孩仰望天空蓝鲸的感人动画 — michaelrabone · 2026-08-26
- Wan 3.0 与 MiniMax H3 视频生成对比:音频与过渡更自然 — SimplyAnnisa · 2026-08-26
- AI 生成舞蹈视频展示炫酷动作效果 — No-Bookkeeper-char · 2026-08-26
- ECCV 2026 新研究:Face Anything 实现任意序列 4D 人脸重建 — rsasaki0109 · 2026-08-26