专题 · FULL STORY

EmbeddingGemma 2:谷歌开源多模态端侧嵌入模型

谷歌 DeepMind 于 10 月 7 日正式发布首个原生多模态嵌入模型 EmbeddingGemma 2(740M 参数),支持图像、音频、视频特征提取,可端侧运行。Uunsloth 等社区随即跟进量化与 GGUF 支持,Google WebAI 团队还实现其浏览器本地运行,生态快速铺开。

2026-10-06 ~ 2026-10-07 · 4 集 · 58 条

第 1 集 · Unsloth 发布 EmbeddingGemma-2 多模态嵌入模型(2026-10-06,2 条)

Unsloth 在 Hugging Face 上发布 EmbeddingGemma-2 嵌入模型,支持图像、音频、视频等多模态特征提取,并随后推出 GGUF 量化版本,迅速登上 Hugging Face 趋势榜榜首。该模型的 pipeline 为 feature-extraction,适合多模态嵌入场景使用,量化版进一步降低了部署门槛。

第 2 集 · 谷歌开源 EmbeddingGemma 2 多模态嵌入模型(2026-10-06,52 条)

谷歌 CEO Sundar Pichai 与 Google DeepMind 于 10 月 7 日正式发布 EmbeddingGemma 2,这是谷歌首个原生多模态、面向端侧部署的开源嵌入模型,以 Apache 2.0 许可开源,权重已上传至 Hugging Face(google/embeddinggemma-2)与 Kaggle,发布当天即在 Hugging Face 模型热榜上攀升。官方博客称其为原生多模态嵌入领域表现最佳的开源模型。

已确认

  • 官方定位:@GoogleDeepMind 与 @sundarpichai 宣布该模型超越纯文本嵌入能力,将代码、图像、音频与视频统一到同一向量空间;@NVIDIAAI 等官方账号亦转发宣传,模型还已登陆 Ollama。据 @philschmid 介绍,模型基于 Gemma 4 构建,是首个基于该架构的原生多模态嵌入模型。
  • 规模:模块化设计,参数量从 270M 到 740M 可调(@osanseviero),最大配置下仅占约 0.5GB 内存;将文本(含代码)、图像、视频与音频统一映射到同一 768 维嵌入空间,支持 Matryoshka Representation Learning,可处理 100 多种语言,上下文窗口 8K。@DynamicWebPaige 与 @Recoil42 补充,纯文本/代码配置仅 270M,图像编码器约 170M、音频编码器约 300M;官方称其性能超过部分体积两倍以上的模型。
  • 端侧实测:@SabooShubham 称可在手机上完全离线运行多模态 RAG,纯文本检索约需 191MB 内存,文本+图像+视频+音频约 567MB(Pixel 11 Pro 实测)。
  • 灵活性:@DynamicWebPaige 指出借助 Matryoshka 嵌入可将向量截断至 128 维以节省存储,并转述 MTEB Code 基准相较此前提升约 14%。
  • 性能:据 Sentence Transformers 维护者 @tomaarsen 摘录的模型卡,768 维全精度下 MMEB v2 视觉文档 67.84 NDCG@5、MMEB v2 视频 50.67 Hit@1、MSEB 音频检索 69.54 MRR@10。
  • 开放性与生态:Apache 2.0 许可,权重上架 Hugging Face 与 Kaggle,支持 transformers 与 sentence-transformers 生态,unsloth 已提供 GGUF 版本(@jacek2023),并已可在 Ollama 上运行。
  • 易用性:@tomaarsen 指出在 Sentence Transformers 中仍可用熟悉的 model.encode() 与 similarity 接口,文本查询可直接检索照片、录音或视频片段;@minchoi 演示了用语音指令在视频中精确定位某一时刻。
  • 应用场景:主打离线、隐私优先的 RAG,可完全在本地设备运行。@HamsterUnfair6313 认为它补齐了「分析图片/视频并用自然语言检索」的关键拼图,适合搭建本地检索应用;@CurieuxExplorer 亦称其让手机可以自己成为照片、录音等内容的搜索引擎。

为什么重要

  • 多模态嵌入此前多依赖云端大模型或分别的单模态模型,EmbeddingGemma 2 用一个轻量模型统一了五种模态的向量表示,大幅降低端侧检索与 RAG 的部署门槛。
  • Matryoshka 嵌入允许按需截断维度,在存储与算力受限的端侧场景进一步压缩成本。
  • Apache 2.0 许可加上 Hugging Face/Kaggle、Ollama 及社区 GGUF 版本的快速跟进,意味着开发者可即刻在本地设备试用,推动隐私优先的离线 AI 应用落地。

还有 32 条相关讨论 →

第 3 集 · EmbeddingGemma 2 可经 WebGPU 在浏览器本地运行(2026-10-07,2 条)

Google 发布 EmbeddingGemma 2 嵌入模型后,Google WebAI 团队的 Jason Mayes 随即放出浏览器端 JavaScript 移植版 Demo,Reddit 用户 xenovatech 也分享了通过 WebGPU 直接在浏览器中运行该模型的演示。整个过程完全在客户端本地完成文本嵌入,无需服务器,实现零成本的浏览器端推理。

第 4 集 · EmbeddingGemma 2 演示文本一搜即得图片视频音频(2026-10-07,2 条)

开发者 tomaarsen 分享了他心目中最佳的多模态嵌入搜索演示:基于 EmbeddingGemma 2,用户在浏览器中输入「Birds」等文本,即可同时检索出鸟类相关的图片、视频和音频片段;此外也支持反向搜索,直接用一张图片或一段声音作为查询来查找相似内容。该演示直观展示了单一多模态 embedding 模型在跨模态统一检索场景下的能力,引发社区关注。