Google 发布 EmbeddingGemma 2:740M 多模态嵌入模型,文本图像音视频统一向量空间
jacek2023 · reddit · 2026-10-06
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,已上架 Hugging Face(unsloth 提供 GGUF 版)。模型共 740M 参数,把文本(含代码)、图像、视频、音频统一映射到 768 维单一向量空间,专为手机、笔记本等消费级设备设计。
要点:
- 架构:270M 文本主干(130M transformer + 140M embedder)+ 可选加载的视觉(170M)与音频(300M)编码器,按需加载模态
- 支持 100+ 语言,代码任务较前代提升约 14%
- 原生支持 Matryoshka 表示学习,可截断到 128d/256d/512d/768d,向量存储成本最多降 6 倍
- 8K 上下文,可处理数分钟音视频
- 通过轻量文本指令前缀为搜索、分类、聚类等任务定制嵌入
适用场景包括端侧搜索、RAG、分类与聚类。
所属事件:谷歌开源 EmbeddingGemma 2 多模态端侧嵌入模型(37 条相关)→
「Infra」频道最新
- DGX Station 外接一张 RTX Pro 6K:DeepSeek V4.1 Flash 预填冲上 6 万 tok/s — Sentdex · 2026-10-07
- Hugging Face 工程师演讲:llama.cpp 与本地 AI 推理生态全景 — unofficialmerve · 2026-10-07
- 谷歌签 20 年核电大单,Constellation 股价单日暴涨 14% — Polymarket · 2026-10-07
- 互联网根密钥 10 月 11 日换签,Cloudflare 详解 DNSSEC KSL 轮换与检测方法 — Cloudflare Blog · 2026-10-07
- 5060 Ti 16GB 跑 Qwen3.8 Flash Next IQ1_M:55 tok/s 还能写出像样落地页 — bobaburger · 2026-10-07
- 16GB RTX 5080 跑 Qwen 3.8 27B:NInfer 调优后解码 96 t/s、11 万上下文 — Kernoriordan · 2026-10-07