专题 · FULL STORY
EmbeddingGemma 2:谷歌开源多模态端侧嵌入模型
谷歌 DeepMind 于 10 月 7 日正式发布首个原生多模态嵌入模型 EmbeddingGemma 2(740M 参数),支持图像、音频、视频特征提取,可端侧运行。Uunsloth 等社区随即跟进量化与 GGUF 支持,Google WebAI 团队还实现其浏览器本地运行,生态快速铺开。
2026-10-06 ~ 2026-10-07 · 4 集 · 58 条
第 1 集 · Unsloth 发布 EmbeddingGemma-2 多模态嵌入模型(2026-10-06,2 条)
Unsloth 在 Hugging Face 上发布 EmbeddingGemma-2 嵌入模型,支持图像、音频、视频等多模态特征提取,并随后推出 GGUF 量化版本,迅速登上 Hugging Face 趋势榜榜首。该模型的 pipeline 为 feature-extraction,适合多模态嵌入场景使用,量化版进一步降低了部署门槛。
- Unsloth 发布 EmbeddingGemma-2:覆盖视觉与音频的多模态嵌入 — unsloth · 2026-10-06
- unsloth 发布 EmbeddingGemma-2 GGUF 量化版,登顶 HF 热门 — unsloth · 2026-10-07
第 2 集 · 谷歌开源 EmbeddingGemma 2 多模态嵌入模型(2026-10-06,52 条)
谷歌 CEO Sundar Pichai 与 Google DeepMind 于 10 月 7 日正式发布 EmbeddingGemma 2,这是谷歌首个原生多模态、面向端侧部署的开源嵌入模型,以 Apache 2.0 许可开源,权重已上传至 Hugging Face(google/embeddinggemma-2)与 Kaggle,发布当天即在 Hugging Face 模型热榜上攀升。官方博客称其为原生多模态嵌入领域表现最佳的开源模型。
已确认
- 官方定位:@GoogleDeepMind 与 @sundarpichai 宣布该模型超越纯文本嵌入能力,将代码、图像、音频与视频统一到同一向量空间;@NVIDIAAI 等官方账号亦转发宣传,模型还已登陆 Ollama。据 @philschmid 介绍,模型基于 Gemma 4 构建,是首个基于该架构的原生多模态嵌入模型。
- 规模:模块化设计,参数量从 270M 到 740M 可调(@osanseviero),最大配置下仅占约 0.5GB 内存;将文本(含代码)、图像、视频与音频统一映射到同一 768 维嵌入空间,支持 Matryoshka Representation Learning,可处理 100 多种语言,上下文窗口 8K。@DynamicWebPaige 与 @Recoil42 补充,纯文本/代码配置仅 270M,图像编码器约 170M、音频编码器约 300M;官方称其性能超过部分体积两倍以上的模型。
- 端侧实测:@SabooShubham 称可在手机上完全离线运行多模态 RAG,纯文本检索约需 191MB 内存,文本+图像+视频+音频约 567MB(Pixel 11 Pro 实测)。
- 灵活性:@DynamicWebPaige 指出借助 Matryoshka 嵌入可将向量截断至 128 维以节省存储,并转述 MTEB Code 基准相较此前提升约 14%。
- 性能:据 Sentence Transformers 维护者 @tomaarsen 摘录的模型卡,768 维全精度下 MMEB v2 视觉文档 67.84 NDCG@5、MMEB v2 视频 50.67 Hit@1、MSEB 音频检索 69.54 MRR@10。
- 开放性与生态:Apache 2.0 许可,权重上架 Hugging Face 与 Kaggle,支持 transformers 与 sentence-transformers 生态,unsloth 已提供 GGUF 版本(@jacek2023),并已可在 Ollama 上运行。
- 易用性:@tomaarsen 指出在 Sentence Transformers 中仍可用熟悉的 model.encode() 与 similarity 接口,文本查询可直接检索照片、录音或视频片段;@minchoi 演示了用语音指令在视频中精确定位某一时刻。
- 应用场景:主打离线、隐私优先的 RAG,可完全在本地设备运行。@HamsterUnfair6313 认为它补齐了「分析图片/视频并用自然语言检索」的关键拼图,适合搭建本地检索应用;@CurieuxExplorer 亦称其让手机可以自己成为照片、录音等内容的搜索引擎。
为什么重要
- 多模态嵌入此前多依赖云端大模型或分别的单模态模型,EmbeddingGemma 2 用一个轻量模型统一了五种模态的向量表示,大幅降低端侧检索与 RAG 的部署门槛。
- Matryoshka 嵌入允许按需截断维度,在存储与算力受限的端侧场景进一步压缩成本。
- Apache 2.0 许可加上 Hugging Face/Kaggle、Ollama 及社区 GGUF 版本的快速跟进,意味着开发者可即刻在本地设备试用,推动隐私优先的离线 AI 应用落地。
- Google 发布 EmbeddingGemma 2:740M 多模态嵌入模型,文本图像音视频统一向量空间 — jacek2023 · 2026-10-06
- 谷歌发布 EmbeddingGemma 2:740M 参数开源多模态嵌入模型 — sundarpichai · 2026-10-07
- DeepMind 官宣 EmbeddingGemma 2:代码图像音视频共享同一嵌入空间 — GoogleDeepMind · 2026-10-07
- Google 发布 EmbeddingGemma 2:740M 参数的原生多模态开源嵌入模型 — GoogleDeepMind · 2026-10-07
- Google 发布 EmbeddingGemma 2:740M 多模态嵌入模型,Apache 2.0 开源 — GlennCameronjr · 2026-10-07
- Google 发布开源嵌入模型 EmbeddingGemma 2:支持五模态、270M 起 — osanseviero · 2026-10-07
- Google 发布 EmbeddingGemma 2:270m-740m 多模态端侧嵌入开源模型 — osanseviero · 2026-10-07
- Google 开源 EmbeddingGemma 2:740M 多模态嵌入模型仅占 0.5GB 内存 — gnukeith · 2026-10-07
- Sentence Transformers 作者详解 EmbeddingGemma 2:768 维统一多模态空间 — tomaarsen · 2026-10-07
- Google 开源 EmbeddingGemma 2:740M 统一嵌入文本图像音视频 — tomaarsen · 2026-10-07
- 文本一查全模态:EmbeddingGemma 2 用同一向量空间检索图音视频 — tomaarsen · 2026-10-07
- 740M 模块化设计:EmbeddingGemma 2 按需加载编码器,纯文本仅 270M — tomaarsen · 2026-10-07
- EmbeddingGemma 2 代码检索提升 14%,多语言小幅领先一代 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 多模态跑分:视觉文档 67.84、视频 50.67、音频 69.54 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 降维实测:128d 缩 6 倍但质量明显下降 — tomaarsen · 2026-10-07
- Matryoshka 训练加持:嵌入维度可裁至 256d 存储省三分之二 — tomaarsen · 2026-10-07
- 嵌入模型任务前缀指南:SearchQuery 配 Document 做检索 — tomaarsen · 2026-10-07
- 一个向量装下整个商品页:多模态嵌入支持图文视频混合检索 — tomaarsen · 2026-10-07
- Google 多模态嵌入模型:图像 280 token、音频每秒 25 token 计价 — tomaarsen · 2026-10-07
- Google 多模态嵌入模型:视觉 token 预算 70 至 1120 可调 — tomaarsen · 2026-10-07
第 3 集 · EmbeddingGemma 2 可经 WebGPU 在浏览器本地运行(2026-10-07,2 条)
Google 发布 EmbeddingGemma 2 嵌入模型后,Google WebAI 团队的 Jason Mayes 随即放出浏览器端 JavaScript 移植版 Demo,Reddit 用户 xenovatech 也分享了通过 WebGPU 直接在浏览器中运行该模型的演示。整个过程完全在客户端本地完成文本嵌入,无需服务器,实现零成本的浏览器端推理。
- Google EmbeddingGemma 2 已可在浏览器内经 WebGPU 本地运行 — xenovatech · 2026-10-07
- Google EmbeddingGemma2 发布,浏览器端 JS 移植版可零成本本地跑 — jason_mayes · 2026-10-07
第 4 集 · EmbeddingGemma 2 演示文本一搜即得图片视频音频(2026-10-07,2 条)
开发者 tomaarsen 分享了他心目中最佳的多模态嵌入搜索演示:基于 EmbeddingGemma 2,用户在浏览器中输入「Birds」等文本,即可同时检索出鸟类相关的图片、视频和音频片段;此外也支持反向搜索,直接用一张图片或一段声音作为查询来查找相似内容。该演示直观展示了单一多模态 embedding 模型在跨模态统一检索场景下的能力,引发社区关注。
- EmbeddingGemma 2 多模态搜索演示:一次检索图视频音频 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 上手演示:一个文本搜图、搜视频、搜音频 — tomaarsen · 2026-10-07