谷歌开源 EmbeddingGemma 2:740M 参数多模态嵌入模型
谷歌 CEO Sundar Pichai 与 Google DeepMind 于 10 月 7 日正式发布 EmbeddingGemma 2,这是谷歌首个原生多模态的开源嵌入模型,也是少见的面向端侧部署的轻量多模态嵌入方案。模型以 Apache 2.0 许可开源,权重已上传至 Hugging Face(google/embeddinggemma-2)与 Kaggle,开发者可即刻下载试用,发布当天即在 Hugging Face 模型热榜上攀升。官方博客称其为原生多模态嵌入领域表现最佳的开源模型。
已确认
- 官方定位:EmbeddingGemma 2 是 DeepMind 首个原生多模态、面向端侧效率设计的开源嵌入模型,超越纯文本嵌入能力,@NVIDIAAI 等官方账号亦转发宣传;据 @philschmid 介绍,模型基于 Gemma 4 构建,是首个基于该架构的原生多模态嵌入模型。
- 规模:采用模块化设计,参数量可从 270M 到 740M 调节(@osanseviero 介绍;最大配置下仅占约 0.5GB 内存),将文本(含代码)、图像、视频与音频统一映射到同一 768 维嵌入空间,支持 Matryoshka Representation Learning,可处理 100 多种语言,上下文窗口 8K。@DynamicWebPaige 补充,纯文本/代码配置仅 270M,图像编码器约 170M、音频编码器约 300M;官方称其性能超过部分体积两倍以上的模型。
- 端侧实测:@SabooShubham 称可在手机上完全离线运行多模态 RAG,纯文本检索约需 191MB 内存,文本+图像+视频+音频约 567MB(Pixel 11 Pro 实测)。
- 灵活性:@DynamicWebPaige 指出借助 Matryoshka 嵌入可将向量截断至 128 维以节省存储;据其转述,MTEB Code 基准相较此前提升约 14%。
- 性能:据 Sentence Transformers 维护者 @tomaarsen 摘录的模型卡,768 维全精度下 MMEB v2 视觉文档 67.84 NDCG@5、MMEB v2 视频 50.67 Hit@1、MSEB 音频检索 69.54 MRR@10。
- Token 计价细节(@tomaarsen):所有模态共享 8,192 token 上下文窗口,默认图像 280 token、视频帧 140 token、音频每秒 25 token(纯音频约可容纳 327 秒),混合输入从同一预算扣减;视频默认每秒采样 1 帧,音频需为 16 kHz 单声道,每图像/帧的视觉 soft token 预算可在 70 至 1120 之间调节,token 越多细节越细但牺牲延迟与上下文容量。
- 开放性:Apache 2.0 许可,权重上架 Hugging Face 与 Kaggle,支持 transformers 与 sentence-transformers 生态,unsloth 已提供 GGUF 版本。
- 易用性:@tomaarsen 指出在 Sentence Transformers 中仍可用熟悉的 model.encode() 与 similarity 接口,文本查询可直接检索照片、录音或视频片段。@minchoi 演示了用语音指令在视频中精确定位某一时刻的玩法。
- 应用场景:主打离线、隐私优先的 RAG,可完全在本地设备运行,无需云端、数据不外传。@HamsterUnfair6313 认为它补齐了「分析图片/视频并用自然语言检索」的关键拼图,适合搭建本地检索应用。
为什么重要
- 多模态嵌入此前多依赖云端大模型或分别的单模态模型,EmbeddingGemma 2 用一个轻量模型统一了五种模态的向量表示,大幅降低端侧检索与 RAG 的部署门槛。
- Matryoshka 嵌入允许按需截断维度,视觉 token 预算可调,在存储与算力受限的端侧场景进一步压缩成本。
- Apache 2.0 许可加上 Hugging Face/Kaggle 及社区 GGUF 版本的快速跟进,意味着开发者可即刻在本地设备上试用,推动隐私优先的离线 AI 应用落地。
2026-10-06 ~ 2026-10-07 · 42 条相关
一手来源
- 谷歌发布 EmbeddingGemma 2:740M 参数开源多模态嵌入模型 — sundarpichai ·
- DeepMind 官宣 EmbeddingGemma 2:代码图像音视频共享同一嵌入空间 — GoogleDeepMind ·
- Google 发布 EmbeddingGemma 2:740M 参数的原生多模态开源嵌入模型 — GoogleDeepMind ·
- Google 发布 EmbeddingGemma 2:740M 多模态嵌入模型,文本图像音视频统一向量空间 — jacek2023 · 2026-10-06
- 【源头】谷歌发布 EmbeddingGemma 2:740M 参数开源多模态嵌入模型 — sundarpichai · 2026-10-07
- 【源头】DeepMind 官宣 EmbeddingGemma 2:代码图像音视频共享同一嵌入空间 — GoogleDeepMind · 2026-10-07
- Sentence Transformers 作者详解 EmbeddingGemma 2:768 维统一多模态空间 — tomaarsen · 2026-10-07
- 文本一查全模态:EmbeddingGemma 2 用同一向量空间检索图音视频 — tomaarsen · 2026-10-07
- 740M 模块化设计:EmbeddingGemma 2 按需加载编码器,纯文本仅 270M — tomaarsen · 2026-10-07
- EmbeddingGemma 2 代码检索提升 14%,多语言小幅领先一代 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 多模态跑分:视觉文档 67.84、视频 50.67、音频 69.54 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 降维实测:128d 缩 6 倍但质量明显下降 — tomaarsen · 2026-10-07
- Matryoshka 训练加持:嵌入维度可裁至 256d 存储省三分之二 — tomaarsen · 2026-10-07
- 嵌入模型任务前缀指南:SearchQuery 配 Document 做检索 — tomaarsen · 2026-10-07
- 一个向量装下整个商品页:多模态嵌入支持图文视频混合检索 — tomaarsen · 2026-10-07
- Google 多模态嵌入模型:图像 280 token、音频每秒 25 token 计价 — tomaarsen · 2026-10-07
- 模型推理别用 FP16:激活值超动态范围会静默退化 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 禁用 FP16:激活超动态范围,会 NaN 或静默降质 — tomaarsen · 2026-10-07
- 谷歌在 Hugging Face 上发布 Embedding Gemma 2 嵌入模型 — victormustar · 2026-10-07
- 谷歌开源 EmbeddingGemma2:740M 全模态嵌入,手机可跑 — AGI Hunt · 2026-10-07
- 740M 参数统一嵌入空间,EmbeddingGemma 2 可在浏览器本地运行 — nicodotdev · 2026-10-07
- Google 多模态嵌入模型 embeddinggemma-2 冲上 Hugging Face 热榜 — google · 2026-10-07
- EmbeddingGemma 2 权重上线 Hugging Face — minchoi · 2026-10-07
- 谷歌开源 740M 多模态嵌入模型,可全程离线跑在设备端 — minchoi · 2026-10-07
- EmbeddingGemma 2 手机端离线跑多模态 RAG,文本仅占 191MB 内存 — Saboo_Shubham_ · 2026-10-07
- Google 开源 EmbeddingGemma 2:191MB 内存跑文本嵌入,手机端离线多模态 RAG — Saboo_Shubham_ · 2026-10-07
另有 19 条近重复转述:GoogleDeepMind · GlennCameronjr · osanseviero · osanseviero · gnukeith · tomaarsen · tomaarsen · DynamicWebPaige · Recoil42 · rseroter · testingcatalog · minchoi · NVIDIAAI · sn2006gy · _philschmid · HamsterUnfair6313 · _philschmid · minchoi · DynamicWebPaige