跳到正文

精选深读Hugging Face21:13

NeoMME:高效的多模态原生和多语言编码器

NeoMME: an efficient Multimodal-native and Multilingual Encoder

新编码器同时处理多模态与多语言,效率提升或受限于模型规模,适合跨语言检索场景。

判断

跨语言视觉文档检索团队原来要在“上生成式 VLM 换多模态能力”和“保留分离编码器省算力”之间选;NeoMME 让 260M 直接进候选,但代价是索引栈要改成晚交互加量化,否则拿不到 6 kB/页的存储收益。

依据

Hugging Face 团队说,NeoMME 是 260M 和 800M 的多语言多模态编码器,不用单独预训练视觉塔,也不用因果语言模型;它把文本 token 和 32×32 图像 patch 送进同一个双向 Transformer,从头用 masked discrete-diffusion(离散掩码扩散:遮住部分文本再让模型重建)训练。检索、分类和 token 标注不靠自回归生成文本,所以团队砍掉 causal decoder(因果解码器:逐词生成文本的模块)的参数和算力,并用动态分辨率让高分辨率文档页占更多 token。对做 visual document retrieval(视觉文档检索:用页面图像找文档)的人,NeoMME-Retriever 一次前向同时返回 dense 和 late-interaction embedding(密集向量与晚交互向量:后者保留多向量做细粒度匹配)。可对照的是:在 NVIDIA L40S GPU、2048×2048 输入下,260M 每秒约 51 页,约为 ColModernVBERT 的两倍;分层 token pooling(分层 token 池化:把多个 token 向量合并成更少向量)和非对称量化把晚交互索引从约 1.5 MB/页压到 6 kB/页,缩小 255×,同时保留 >95% baseline nDCG@10(前 10 条排序质量指标)。取舍在于省掉视觉塔和生成解码器降低基础模型开销,但晚交互索引仍需单独存储和量化;若团队已押注单向量索引或生成式 VLM 后处理,迁移成本不在编码器本身。

  • 260M 编码吞吐约 51 页/秒
  • 对比 ColModernVBERT约 2 倍
  • 晚交互索引每页约 1.5 MB → 6 kB
  • 索引压缩后 nDCG@10>95% 基线
NeoMME 的吞吐、索引压缩与质量保留对照

没写清 材料没给 NeoMME 在非英语、非拉丁语系查询上的单独 nDCG@10,也没说 260M 与 800M 在同样索引压缩下的检索质量差,因此不能替它判断哪一档该优先。

下一步 下一步看 Hugging Face 的 NeoMME collection 或技术报告是否放出 ViDoRe v3 上 260M/800M 的逐语言 nDCG@10 和 6 kB/页配置的复现脚本。

本期其他新闻

  1. 行业动态

    一线防御者的黎明:10亿美元保护关键服务

    OpenAI

  2. AI工具

    在macOS上使用Blender与编码Agent

    Simon Willison

  3. AI工具

    Astra的Pelican对比网格相当有趣

    Simon Willison

  4. 精选深读

    面向开发者推出GPT-6 Astra

    Simon Willison

  5. 精选深读

    推出WeatherNext 3:我们最先进、最准确的全球天气AI模型

    Google DeepMind