Google 发布 EmbeddingGemma 2:740M 参数、文本图像音视频统一向量空间

Recoil42 · reddit · 2026-10-07

Google DeepMind 发布开源多模态 embedding 模型 EmbeddingGemma 2,将文本(含代码)、图像、视频、音频及其组合映射到同一个 768 维向量空间。模型总参数 740M,由 270M 文本模型加 170M 视觉、300M 音频模块化编码器组成。设计目标是跑在手机、笔记本等消费级硬件上,面向端侧搜索、RAG、分类和聚类等低延迟语义检索场景。

所属事件:谷歌开源 EmbeddingGemma 2 多模态端侧嵌入模型(37 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →