跳到正文

精选深读Google DeepMind

来源时间 本站刊期

EmbeddingGemma 2:一个开放、轻量的多模态嵌入模型

EmbeddingGemma 2: an open, lightweight multimodal embedding model

EmbeddingGemma 2主打端侧开放轻量,多模态检索精度需实测。

判断

端侧 RAG 和本地搜索的开发者要重新决定:是否把多模态检索从服务端向量库迁到本地推理的 EmbeddingGemma 2,还是继续为图像、音频单独维护编码器。

依据

Google DeepMind 研究工程师 Sahil Dua 与 Henrique Schechter Vera 在 10月6日 的发布文中称,EmbeddingGemma 2 是其尺寸段内最强的端侧多模态嵌入模型。机制上它把文本、图像、音频、视频映射进同一嵌入空间:文本权重最低 270M 参数,视觉编码器 170M、音频编码器 300M 可选加载,纯文本场景因此不必付多模态的内存代价。存储侧用 MRL(Matryoshka Representation Learning,套娃式表示学习)把输出向量从 768 维截断到 512、256 或 128 维,官方称最高带来 6x 存储缩减。量化后在 Google Pixel 11 Pro 上,纯文本权重约 191MB 活跃内存,全模态约 567MB。上一代 EmbeddingGemma 的下载量超过 20 million。

  • 参数总量740 million
  • 文本权重活跃内存~191MB
  • 全模态活跃内存~567MB
  • 上一代下载量20 million
EmbeddingGemma 2 的模型规模、端侧内存与上一代下载量对照

没写清 材料只写 EmbeddingGemma 2 在 MTEB Code 与 MAEB 上取得领先分数,没给出具体分数和对照模型,所以无法判断多模态检索精度实际高出多少。

下一步 核对官方模型卡里 MTEB Code 与 MAEB 的具体分数、参数量级和评测条件。

本期其他新闻

  1. 行业动态

    OpenAI 将默认对 ChatGPT 输出添加水印——但仅限于欧盟

    Ars Technica AI

  2. 行业动态

    使用 Parseable 配合 Datasette 处理 OpenTelemetry traces

    Simon Willison

  3. 行业动态

    《Artificial》辛辣讽刺 AI 创造者——并对其危险发出黑暗警告

    Wired AI

  4. 行业动态

    OpenAI 又惹怒了一群数学家

    Wired AI

  5. 行业动态

    Atlassian 与 OpenAI 扩大合作,将企业知识转化为行动

    OpenAI

  6. AI工具

    在 AgentCore 和 OpenClaw 上构建上下文感知的 AI 助手

    AWS Machine Learning Blog