精选深读Google DeepMind
来源时间 本站刊期
EmbeddingGemma 2:一个开放、轻量的多模态嵌入模型
EmbeddingGemma 2: an open, lightweight multimodal embedding model
EmbeddingGemma 2主打端侧开放轻量,多模态检索精度需实测。
判断
端侧 RAG 和本地搜索的开发者要重新决定:是否把多模态检索从服务端向量库迁到本地推理的 EmbeddingGemma 2,还是继续为图像、音频单独维护编码器。
依据
Google DeepMind 研究工程师 Sahil Dua 与 Henrique Schechter Vera 在 10月6日 的发布文中称,EmbeddingGemma 2 是其尺寸段内最强的端侧多模态嵌入模型。机制上它把文本、图像、音频、视频映射进同一嵌入空间:文本权重最低 270M 参数,视觉编码器 170M、音频编码器 300M 可选加载,纯文本场景因此不必付多模态的内存代价。存储侧用 MRL(Matryoshka Representation Learning,套娃式表示学习)把输出向量从 768 维截断到 512、256 或 128 维,官方称最高带来 6x 存储缩减。量化后在 Google Pixel 11 Pro 上,纯文本权重约 191MB 活跃内存,全模态约 567MB。上一代 EmbeddingGemma 的下载量超过 20 million。
- 参数总量740 million
- 文本权重活跃内存~191MB
- 全模态活跃内存~567MB
- 上一代下载量20 million
没写清 材料只写 EmbeddingGemma 2 在 MTEB Code 与 MAEB 上取得领先分数,没给出具体分数和对照模型,所以无法判断多模态检索精度实际高出多少。
下一步 核对官方模型卡里 MTEB Code 与 MAEB 的具体分数、参数量级和评测条件。