谷歌开源 EmbeddingGemma2:740M 全模态嵌入,手机可跑

AGI Hunt · wechat · 2026-10-07

谷歌 CEO Sundar Pichai 与 Google DeepMind 同时官宣开源 EmbeddingGemma2,称其为谷歌首个开源的原生多模态 Embedding 模型,权重已上 Hugging Face,协议为 Apache 2.0。

模型结构:740M 是全模态合计,由三块拼成——文本主干 270M(130M transformer + 140M embedder)、视觉编码器 170M、音频编码器 300M,后两块可不加载,因此有四种规格:纯文本 270M、文本+图片 440M、文本+音频 570M、全模态 740M。基于 Gemma 4 架构,共用同一套文本 tokenizer 和音频编码器。

关键参数:输出 768 维向量,支持 100 多种语言;上下文 8K token(上一代 4 倍),一次可放 5.5 分钟音频、29 张图片或 58 帧视频;支持 Matryoshka 表示学习,768 维可截到 512/256/128 维,向量库存储最多降到六分之一;文本输入可带任务前缀。量化后在 Pixel 11 Pro 上纯文本约占 191MB 内存,全模态约 567MB。

两个坑:截到 256 维基本不掉分,但 128 维多模态分数大跌(MMEBv2 从 59.01 掉到 45.65),官方建议 128 维只用于纯文本;不要用 float16,激活值超出其范围会变 NaN 或悄悄变差且不报错,应用 bfloat16 或 float32。

跑分(768 维全精度):文本 MTEB 多语言 v2 61.36(上一代 61.15),MTEB 代码 v1 78.68(上一代 68.76,涨近 10 分);图片 MIEB lite 64.64、MMEBv2 Image 57.28、VisDoc 67.84、Video 50.67;音频 MSEB 检索 69.54、MAEB 49.39。官方定位为 1B 以下最强多模态 Embedding 模型之一。

对比友商:纯文本比 Qwen3-Embedding-0.6B 低约 3 分,多模态 MMEB-V2 比 Qwen3-VL-Embedding-2B 低 14 分,但后者最小 2B 且不支持音频;OpenAI text-embedding-3-large 的 MTEB 多语言 58.93,被其 270M 文本部分超 2 分多,且 OpenAI 嵌入至今仅支持文本。

生态与 demo:transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LM Studio 均已支持,浏览器可用 transformers.js 或 WebGPU,Unsloth 提供微调教程。官方配了四个 demo:手机相册 InstantMediaSearch、视频片段定位 VideoMomentsFinder、本地文件检索 Foresight、实时决策 MediaPipe Decision Task API(小恐龙跑酷中 270M 模型一次决策 43ms,普通 LLM 需 640ms)。

背景:Embedding 线上一代是去年 9 月的初代 EmbeddingGemma(308M 纯文本,Gemma 协议),下载量已超 2000 万次,此次间隔 13 个月并换成 Apache 2.0。文中还提到今年 4 月 OpenAI 误发 text-embedding-3-small 下线通知的乌龙,引发开发者对闭源嵌入模型下线风险的讨论。

所属事件:谷歌开源 EmbeddingGemma 2 端侧多模态嵌入模型(43 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →