一文看懂 EmbeddingGemma 2:六步把五模态压进 768 维向量
KyeGomezB · x · 2026-10-10
Google 发布的 EmbeddingGemma 2 将文本、代码、图像、视频、音频映射到共享向量空间,便于语义比较与多模态检索。架构分六步:
- 文本编码:24 层 Transformer,采用局部+全局注意力。
- 视觉编码:16 层 ViT 将图像转为视觉 token。
- 音频编码:12 层 Conformer 将音频特征转为音频 token。
- 多模态融合:视觉与音频 token 与文本 token 对齐后联合处理。
- 投影:池化为 768 维、L2 归一化的单一向量。
- Matryoshka 嵌入:可截断到 512/256/128 维,保留信息的同时省存储与算力。
「模型」频道最新
- 一次 GitHub push 攻克 500 大数学难题中 92 道,数学界开始动摇 — altryne · 2026-10-10
- Polymarket开盘赌Grok 5:年内发布概率仅55% — Polymarket · 2026-10-10
- 修复排名 bug 后,gpt-live-1 登顶语音到语音模型榜 — pbbakkum · 2026-10-10
- DeepSeek-V4 答案随 2 token 注入翻转,NIAH 波动达 40 分 — Francis_YAO_ · 2026-10-10
- Artificial Analysis 预告 AA-Robotics:前沿模型零样本操控机械臂 — ArtificialAnlys · 2026-10-10
- Wes Roth 放话:超智模型 Argon 即将到来 — _philschmid · 2026-10-10